- 6 次围观
用于单细胞转录组学的基础模型有望学习细胞状态的可泛化表征。然而,近期证据表明,这类模型往往未能优于简单的机器学习基线。此外,它们在未见实验条件之间的泛化能力仍缺乏充分理解,尤其是在植物领域,目前除细胞类型注释和批次整合之外,尚缺乏严格的评估。 为应对这一问题,我们提出了一个拟南芥(Arabidopsis thaliana)基础模型 scAraFM,并在若干扰动条件下对其进行了基准测试,采用了三种难度逐步提升的评估方案:来自单一实验的随机划分、基于重复的划分,以及跨实验迁移学习。我们发现,与跨实验评估相比,随机划分会将性能高估多达 30 个点。在各种表征策略中,保留基因身份的信息始终优于标准的池化嵌入。此外,在单实验设置下,使用原始读数的简单基线仍具有竞争力,这对当前关于基础模型具有普遍优势的主张提出了挑战。 相较之下,在跨实验迁移条件下,预训练表征显示出额外价值,尤其是在标注样本较少时,这表明基础模型的优势恰恰出现在实际部署中最关键的情境中。总体而言,我们的结果表明,关于基础模型的结论在很大程度上依赖于评估设计;同时,在下游任务中保留逐基因结构有助于提升泛化能力,从而支持在未见实验背景下进行稳健预测。
用于单细胞转录组学的基础模型有望学习细胞状态的可泛化表征。然而,近期证据表明,它们往往无法优于简单的机器学习基线。此外,它们在未见实验条件下的泛化能力仍知之甚少,尤其是在植物领域;在该领域中,除细胞类型注释和批次整合之外,仍缺乏严格的评估。
为此,我们提出了一个拟南芥基础模型 scAraFM,并在若干扰动条件下,按照三种难度逐步递增的协议对其进行基准评测:来自单一实验的随机划分、基于重复的划分,以及跨实验迁移学习。我们发现,与跨实验评估相比,随机划分会将性能高估多达 30 个百分点。在各种表征策略中,保留基因身份始终优于标准的池化嵌入。此外,使用原始读数的简单基线在单实验设定中仍然具有竞争力,这对当前关于基础模型具有普遍优势的说法提出了挑战。
相比之下,在跨实验迁移条件下,预训练表征显示出额外价值,尤其是在标注样本较少时,这表明基础模型的优势恰恰体现在对实际部署最为关键的场景中。总体而言,我们的结果表明,对基础模型的结论在很大程度上取决于评估设计;同时,保留逐基因结构有助于下游任务中的泛化,从而支持在未见实验背景下进行稳健预测。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.21.746324v1?rss=1
🏷️ 单细胞RNA测序 基础模型 跨实验泛化 植物扰动响应 拟南芥 迁移学习
来源出处
关于单细胞RNA测序基础模型在跨实验分布偏移条件下植物扰动响应预测鲁棒性的研究
https://www.biorxiv.org/content/10.64898/2026.08.21.746324v1?rss=1