- 8 次围观
扩散模型正日益被用于预测扰动引起的转录响应,但它们是否优于更简单的生成式基线方法和基于表征的基线方法仍不明确。现有评估往往未能区分模型架构、输入表征、生物学背景和评价指标选择所带来的影响,因此难以判断基于扩散的方法在哪些情况下真正有用。本文提出了 PertDiffBench,这是一个用于评估基于扩散的转录组扰动预测方法的标准化基准,涵盖单细胞和 bulk RNA-seq 数据集。PertDiffBench 从三个互补的评估场景对基于扩散的模型进行评估:已知单细胞背景和 bulk 扰动条件下的标准预测、对未见细胞类型/物种/药物及中间时间点的泛化能力,以及针对特征维度、输入表征、噪声类型和基因排序的压力测试。在这些评估场景中,扩散模型并未表现出一致性的优势。scGen 在常规预测任务中仍然是一个强有力的基线,而 scDiffusion 则是在若干泛化场景中最具竞争力的基于扩散的方法。时间插补呈现出不同的模式:一个直接在表达空间中运行的简单 DDPM 优于更为专门化的模型。压力测试表明,模型性能依赖于具体模型,并且对特征维度、编码器选择、噪声类型和基因排序较为敏感。预训练编码器并未持续带来性能提升,在已见条件和未见细胞类型的设定下,经典的 scVI 表征略微优于 STATE。这些结果表明,扩散模型在扰动响应预测中的表现高度依赖于任务设计和表征选择。PertDiffBench 为在生物学条件多样且经过压力测试的场景下评估这类模型提供了一个实用框架。
扩散模型正越来越多地被用于预测扰动引起的转录响应,但其是否优于更简单的生成式基线方法和基于表征的方法,仍不清楚。现有评估往往未能区分模型架构、输入表征、生物学背景以及评价指标选择所带来的影响,因此难以判断基于扩散的方法在哪些情形下真正有用。本文提出 PertDiffBench,这是一个用于评估基于扩散的转录组扰动预测方法的标准化基准,涵盖单细胞和 bulk RNA-seq 数据集。
PertDiffBench 从三个互补的评估设置对基于扩散的模型进行评估:其一是在已知单细胞背景和 bulk 扰动条件下的标准预测;其二是对未见过的细胞类型、物种、药物以及中间时间点的泛化能力;其三是针对特征维度、输入表征、噪声类型和基因排序的压力测试。在这些设置中,扩散模型并未表现出一致性的优势。scGen 在常规预测任务中仍然是一个强有力的基线,而 scDiffusion 则是在若干泛化场景中最具竞争力的基于扩散的方法。时间插补呈现出不同的模式:一个直接在表达空间中运行的简单 DDPM 优于更为专门化的模型。压力测试表明,模型性能依赖于具体模型,并且对特征维度、编码器选择、噪声类型和基因排序较为敏感。预训练编码器并未持续带来性能提升,在已见条件和未见细胞类型的设置中,经典的 scVI 表征略优于 STATE。
这些结果表明,扩散模型在扰动响应预测中的性能在很大程度上取决于任务设计和表征选择。PertDiffBench 为在生物学条件多样且经过压力测试的环境下评估此类模型提供了一个实用框架。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.06.13.732013v1?rss=1
🏷️ 单细胞转录组 扰动响应预测 扩散模型 基准测试 RNA-seq 生成模型