- 8 次围观
扰动转录组学是理解基因功能和药物效应的有力工具,然而,预测扰动如何在不同生物学背景中表现仍然是一个核心挑战,这限制了从模型系统向临床相关组织的转化。尽管人们对这一问题的兴趣日益增长,但基准评测工作一直受到评价任务定义不一致、评价指标异质,以及对不同扰动类型和生物系统评估有限等问题的阻碍。本文提出了一个用于跨背景扰动特征预测的基准评测框架(我们将该任务定义为特征重背景化,signature recontextualization),其基础是对预测任务、目标数据可用性以及以特征恢复为核心的评价指标进行明确界定。该框架在三种目标背景数据情境下评估预测性能:(1)仅对照(control only),即仅测量目标背景中的对照谱;(2)低覆盖(low coverage),即仅测量目标背景中有限子集的扰动;以及(3)高覆盖(high coverage),即测量目标背景中大多数扰动。该设计能够系统评估预测性能如何依赖于目标背景样本量,同时为不同方法的比较提供标准化基础。 我们评估了新开发的基于投影的方法(projectCor)和基于网络的方法(netProp),并将其与基于深度学习的基础模型(scGPT、STACK)以及统计学基线方法进行比较。该基准涵盖四个多样化的扰动数据集:细胞系中的 CRISPR 敲低和药物扰动,以及来自 DrugMatrix 的大鼠组织体内化学扰动,从而将评估范围从孤立的细胞系模型扩展到组织层面的响应。在各项任务中,投影和网络传播方法在不同扰动类型和生物学背景下均表现出较强的灵活性,并且在若干情况下可达到或超过深度学习和基础模型的性能,这表明模型复杂性并不会天然提升跨背景泛化能力。我们进一步表明,扰动的可预测性会随着通路保守性、转录响应强度以及源背景与目标背景之间的基线相似性而显著变化。所有数据集、方法和评估工具均已作为开源 R 包(sigRecon)发布,为可复现的基准评测和未来方法开发提供了基础。
扰动转录组学是理解基因功能和药物效应的强大工具,然而,预测扰动如何在不同生物学背景中表现出来仍然是一个核心挑战,这限制了从模型系统向临床相关组织的转化。尽管人们对这一问题的兴趣日益增长,但基准评测工作一直受到评估任务不一致、指标异质性以及对不同扰动类型和生物系统评估有限的制约。在此,我们提出了一个用于跨背景扰动特征预测的基准评测框架(我们将这一任务定义为特征重背景化),该框架建立在对预测任务、目标数据可用性以及以特征恢复为核心的评估指标的明确界定之上。
该框架在三种目标背景数据条件下评估预测性能:(1)仅对照,其中仅测量目标背景中的对照表达谱;(2)低覆盖度,其中仅测量目标背景中有限子集的扰动;以及(3)高覆盖度,其中测量目标背景中的大多数扰动。这一设计能够系统评估预测性能如何依赖于目标背景样本量,同时为方法比较提供标准化基础。
我们评估了新开发的基于投影的方法(projectCor)和基于网络的方法(netProp),并将其与基于深度学习的基础模型(scGPT、STACK)及统计学基线方法进行比较。该基准涵盖四类多样化的扰动数据集:细胞系中的 CRISPR 敲低和药物扰动,以及来自 DrugMatrix 的大鼠组织体内化学扰动,从而将评估范围从孤立的细胞系模型扩展到组织水平响应。
在各项任务中,投影方法和网络传播方法在不同扰动类型和生物学背景下表现出较强的灵活性,并且在若干情况下,其性能与深度学习和基础模型相当甚至更优,这表明模型复杂性并不会天然提升跨背景泛化能力。我们进一步表明,扰动的可预测性会随着通路保守性、转录响应强度以及源背景与目标背景之间的基线相似性而发生显著变化。所有数据集、方法和评估工具均以开源 R 包(sigRecon)的形式发布,为可复现的基准评测和未来方法开发提供了基础。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.14.744937v1?rss=1
🏷️ 扰动转录组学 跨背景预测 基准评测 特征重背景化 网络传播 深度学习模型