癌症细胞系异质性构成了大规模虚拟扰动筛选的首要瓶颈

root 提交于 周一, 08/17/2026 - 14:47
UniPert-G2CP(Li 等,Cell,2026)在五种癌细胞系中,从分子表征到表型建模,打通了遗传筛选与化学筛选之间的联系[1]。本文将该架构扩展至 162 种细胞系、32,039 种化合物以及全基因组输出(12,328 个基因),并发现所得预测平台揭示出显著的性能分化:正常细胞系和原代细胞系的预测保真度显著高于癌细胞系(按细胞系统计的 Pearson 相关系数(PCC)平均值 = 0.480,中位数 0.502;癌细胞系为 0.296,中位数 0.324;Mann-Whitney p = 3.93e-11),表明癌细胞系异质性是大规模虚拟扰动筛选的主要瓶颈。为理解这一分化的来源,我们分析了各细胞系性能、全基因组范围内的方向性准确率、机制聚类(SMD)以及化合物-蛋白相互作用(CPI)富集。 在效应量排名前 5% 的基因上,方向性准确率达到 73.8%(全基因组范围为 60.8%),且呈现通路依赖性的恢复模式:在跨三个细胞系检索的四组有文献支持的扰动-基因配对中,有两组被成功重现(地塞米松-TSC22D3/NFKBIA/FKBP5;硼替佐米-BAG3/DNAJB1/HSPA1A),一组未出现(ASC 中 CD36 耗竭-PPARG/CEBPA),还有一组被部分重现(HEPG2 中二甲双胍-SLC7A5)。所学习嵌入的机制聚类 SMD 达到 1.636(原始值为 1.85;在细胞系覆盖扩大至 32 倍时保留了 88.5%),超过 ECFP4 指纹基线(1.613);同时,自一致性 Mantel rho = 0.852 证实模型在内部保留了化合物作用机制结构。总体留出测试性能为:遗传扰动 PCC = 0.442(978 基因子集);新药 PCC = 0.3047(全基因组范围)。 对 CPI 富集的分析表明,训练数据重叠会抬高表观性能:Touchstone 评估对中有 54.9% 与我们基于 ChEMBL 构建的训练 CPI 对重叠,使得 top 0.5% 下的有效富集因子(EF)从 139 降至 109,但仍远高于随机水平(1.0)。这些发现首次建立了扰动到表型预测中细胞类型依赖泛化能力的大规模表征。正常细胞系与癌细胞系之间观察到的性能分层,为解释虚拟细胞模型为何在异质性癌症背景下性能下降提供了可检验的假设,并为识别此类模型在何处以及为何失效提供了诊断框架。这些发现为未来的架构改进提供了依据,改进方向包括 CPI 词汇空缺、蛋白编码器设计以及细胞类型感知训练策略。

UniPert-G2CP(Li 等,Cell,2026)在五种癌症细胞系中,构建了一个从分子表征到表型建模、连接遗传筛选与化学筛选的框架[1]。在此,我们将这一架构扩展至 162 种细胞系、32,039 种化合物以及全基因组输出(12,328 个基因),并发现所得预测平台揭示出显著的性能分化:正常和原代细胞系的预测保真度显著高于癌症细胞系(每细胞系平均 Pearson 相关系数(PCC)= 0.480,中位数 0.502;癌症细胞系为 0.296,中位数 0.324;Mann-Whitney p = 3.93e-11),从而表明癌症细胞系异质性是大规模虚拟扰动筛选的主要瓶颈。为理解这一分化的来源,我们分析了每细胞系性能、全基因组方向准确率、机制聚类(SMD)以及化合物-蛋白相互作用(CPI)富集。对效应量排名前 5% 基因的方向准确率达到 73.8%(全基因组范围为 60.8%),且恢复效果具有通路依赖性:在跨三个细胞系查询的四组有文献支持的扰动-基因配对中,有两组被成功重现(地塞米松-TSC22D3/NFKBIA/FKBP5;硼替佐米-BAG3/DNAJB1/HSPA1A),一组未出现(ASC 中 CD36 耗竭-PPARG/CEBPA),一组部分重现(HEPG2 中二甲双胍-SLC7A5)。所学习嵌入的机制聚类 SMD 达到 1.636(原始值为 1.85;在细胞系覆盖增加 32 倍时保留了 88.5%),超过 ECFP4 指纹基线(1.613),同时自一致性 Mantel rho = 0.852 证实该模型在内部保留了化合物作用机制结构。总体留出集性能为:遗传扰动 PCC = 0.442(978 基因子集);新药物 PCC = 0.3047(全基因组)。对 CPI 富集的分析表明,训练数据重叠会夸大表观性能:Touchstone 评估对中有 54.9% 与我们基于 ChEMBL 构建的训练 CPI 对重叠,使得 top 0.5% 处的有效富集因子(EF)从 139 降至 109,但仍显著高于随机水平(1.0)。这些发现确立了首个关于扰动到表型预测中细胞类型依赖泛化的大规模表征。正常细胞系与癌症细胞系之间观察到的性能分层提出了可检验的假设,用以解释为何虚拟细胞模型会在异质性癌症背景中性能下降,并提供了一个用于识别此类模型在何处以及为何失效的诊断框架。这些发现为未来的架构改进提供了依据,改进方向包括针对 CPI 词汇空缺、蛋白编码器设计以及细胞类型感知训练策略。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.10.743942v1?rss=1

🏷️ 癌症细胞系异质性 虚拟扰动筛选 化学基因组学 细胞类型泛化 化合物-蛋白相互作用 预测建模