OmicsFM将蛋白质组学带入基础模型时代

root 提交于 周六, 08/29/2026 - 16:47
尽管已有研究表明,基础模型能够从大规模转录组图谱中学习生物学表征,但蛋白质组学数据是否同样具备这一能力仍是未知的。为此,我们提出 OmicsFM:一种与模态无关的 Transformer 模型,通过在前所未有的蛋白质组学数据集上进行掩码丰度重建预训练而成。该数据集包含来自 1,397 个经重新处理的 PRIDE 项目的 48,837 个质量筛选后的蛋白质组学谱。值得注意的是,尽管其训练所用的样本数量分别仅为匹配的批量转录组模型和单细胞转录组模型的 1/14 至 1/93,我们的蛋白质组学模型仍可达到与二者相媲美的性能。在留出的项目上,OmicsFM 的注意力网络在九个揭示通路层面组织结构的参考数据库中,恢复出的分子关系数量多于共表达方法和现有的单细胞基础模型。样本层面的嵌入在不同独立研究之间保留了生物学结构;其表征还成功迁移至细胞类型分类、基因必需性预测和扰动响应预测任务,并始终优于针对特定任务训练的模型。此外,我们的结果表明,蛋白质组学和转录组学表征捕获了互补的生物学信息。因此,OmicsFM 有力地确立了训练高性能蛋白质组学基础模型的可行性,以及此类模型在建模和揭示基础生物学规律方面的重要性。

尽管已有研究表明,基础模型能够从大规模转录组图谱中学习生物学表征,但蛋白质组学数据是否同样具备这一能力仍是未知的。因此,我们在此提出 OmicsFM:一种与模态无关的 Transformer 模型,通过在前所未有的蛋白质组学数据集上进行掩码丰度重建预训练而得到。该数据集包含来自 1,397 个经过重新处理的 PRIDE 项目的 48,837 个经质量筛选的蛋白质组学谱。值得注意的是,尽管其训练所用的谱数量分别仅为匹配的批量和单细胞转录组模型的 1/14 至 1/93,我们的蛋白质组学模型仍可与二者相媲美。在留出的项目上,OmicsFM 的注意力网络在揭示通路层面组织结构的九个参考数据库中,恢复出的分子关系数量超过了共表达方法和现有单细胞基础模型。样本层面的嵌入在不同独立研究之间保留了生物学结构;其表征还成功迁移至细胞类型分类、基因必需性预测和扰动响应预测任务,并且始终优于面向特定任务的模型。此外,我们的结果表明,蛋白质组学和转录组学表征捕获了互补的生物学信息。因此,OmicsFM 有力地确立了训练高性能蛋白质组学基础模型的可行性,以及这类模型在建模和揭示基础生物学规律方面的重要性。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.25.747021v1?rss=1

🏷️ 蛋白质组学 基础模型 Transformer 掩码重建预训练 多组学表征 迁移学习