- 4 次围观
单细胞基础模型是大型的、自监督的深度学习网络,在数百万个细胞转录组上进行了预训练。这些模型有望提供可迁移于多种生物学领域的细胞表征,并且在用于特定任务时,其表现将优于范围狭窄的模型。一个核心假设是,更多的预训练数据会转化为更好的下游性能。然而,尽管这一假设居于核心地位,却在很大程度上尚未经过检验。在本文中,我们在大规模缩减数据集的条件下,针对金标准基准任务测试了下游性能,结果表明,一旦允许微调,性能对预训练数据规模总体上并不敏感。这一趋势揭示了一种微调掩蔽效应:它抵消了由预训练所诱导的表征质量差异,使得在当前基准设定下,额外扩大预训练规模所带来的益处几乎不可见。 这些发现对当前的基准评测标准提出了挑战,因为这些标准依赖于封闭式的微调任务,而此类任务过于狭窄,无法揭示预训练表征的全部价值。它们也对单细胞基础模型发展的主要驱动力提出了挑战,至少在通过常见的狭窄任务进行评估时是如此。我们提出,下一代基础模型的评估应当较少依赖其在高度优化的微调任务上的表现,而应更多关注其支持开放式生物学推断、冻结表征评估以及零样本能力的能力。
单细胞基础模型是大型的、自监督的深度学习网络,通常在数百万个细胞转录组上进行预训练。这类模型有望提供可迁移于多种生物学领域的细胞表征,并且在用于特定任务时,表现优于范围较窄的专用模型。其核心假设是:更多的预训练数据会转化为更好的下游性能。然而,尽管这一假设居于核心地位,却在很大程度上尚未经过检验。在此,我们通过在大规模缩减数据集的条件下,对金标准基准测试任务中的下游性能进行检验,表明一旦允许微调,模型性能对预训练数据规模总体上并不敏感。这一趋势揭示了一种微调掩蔽效应:它抵消了由预训练所诱导的表征质量差异,从而使额外扩大预训练规模所带来的收益在当前基准设定下几乎不可见。
这些发现对当前的基准测试标准提出了挑战,因为现有标准依赖于封闭式的微调任务,而这类任务过于狭窄,无法揭示预训练表征的全部价值。它们也对单细胞基础模型发展的主要驱动力提出了挑战,至少在通过常见的狭窄任务进行评估时是如此。我们提出,下一代基础模型的评估应减少对高度优化的微调任务性能的依赖,而更多关注其支持开放式生物学推断、冻结表征评估以及零样本能力的能力。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.06.04.730272v1?rss=1
🏷️ 单细胞转录组 基础模型 微调评估 预训练缩放 零样本学习 表征学习
来源出处
微调掩盖了细胞基础模型狭窄任务评估中的挑战
https://www.biorxiv.org/content/10.64898/2026.06.04.730272v1?rss=1