- 2 次围观
单细胞基础模型近年来已成为一种颇具前景的方法,用于从大规模转录组数据中学习通用表征。这些模型在数百万个细胞上进行训练,并被设计用于将其学习到的表征迁移到广泛的下游任务中。然而,与传统方法相比,它们在实践中的实际收益仍未得到充分理解。 本研究评估了四种基础模型,即 scGPT、SCimilarity、UCE 和 Transcriptformer,涵盖四项下游任务:细胞类型注释、人类数据整合、跨物种数据整合以及蛋白质表达预测。利用多个公开单细胞数据集,对各模型生成的嵌入进行了评估,并与传统机器学习基线方法进行了比较。模型性能通过任务特异性的评估指标进行衡量,包括分类、整合和回归指标。 结果表明,基础模型生成的嵌入并未持续优于传统方法。在细胞类型注释任务中,基线方法在大多数数据集上取得了最强的性能。然而,在蛋白质表达预测任务中,基础模型的嵌入总体上比基线方法产生了更准确的预测,其中 SCimilarity 达到了最低的预测误差,而 Transcriptformer 获得了最高的相关性得分。在数据整合任务中,所有基础模型均取得了中等水平的结果,而 scVI(基线方法)实现了最强的数据整合性能。 总体而言,结果表明,当前的单细胞基础模型在零样本条件下可为某些下游任务提供有用的表征,但尚不能作为任务特异性方法的通用替代方案。其有效性仍然取决于具体应用场景和评估设置。
单细胞基础模型近年来已成为一种颇具前景的方法,用于从大规模转录组数据中学习通用表示。这些模型在数百万个细胞上进行训练,旨在将其所学习到的表示迁移到广泛的下游任务中。然而,与传统方法相比,它们在实际应用中的优势仍未被充分理解。本研究评估了四种基础模型,即 scGPT、SCimilarity、UCE 和 Transcriptformer,涵盖四项下游任务:细胞类型注释、人类数据整合、跨物种数据整合以及蛋白质表达预测。针对每种模型生成的嵌入表示,研究使用多个公开的单细胞数据集进行了评估,并与传统机器学习基线方法进行了比较。模型性能通过任务特异性的评估指标进行衡量,包括分类、整合和回归指标。
结果表明,基础模型生成的嵌入表示并未始终优于传统方法。在细胞类型注释任务中,基线方法在大多数数据集上取得了最强的性能。然而,在蛋白质表达预测任务中,基础模型的嵌入表示总体上比基线方法产生了更准确的预测,其中 SCimilarity 达到了最低的预测误差,而 Transcriptformer 获得了最高的相关性得分。在数据整合任务中,所有基础模型均取得了中等水平的结果,而 scVI(基线方法)实现了最强的整合性能。总体而言,结果表明,当前的单细胞基础模型在零样本条件下能够为某些下游任务提供有用的表示,但尚不能作为任务特异性方法的通用替代方案。其有效性仍然取决于具体应用和评估设定。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.03.739553v1?rss=1
🏷️ 单细胞转录组 基础模型 零样本学习 模型基准评测 数据整合 蛋白表达预测
来源出处
零样本设定下单细胞基础模型的基准评测
https://www.biorxiv.org/content/10.64898/2026.08.03.739553v1?rss=1