- 2 次围观
在进化序列上训练的蛋白质语言模型(PLM)能够学习编码蛋白质结构的表征,从而无需多序列比对(MSA)即可直接预测结构。本文介绍了 Atlas 模型家族,这是一个开放且可训练的系统,涵盖蛋白质语言建模、单体折叠和蛋白质复合物预测。AtlasLM-3B 是一个具有 30 亿参数规模的语言模型,采用掩码语言建模方法在约 15.6 亿条序列(包括宏基因组数据)上进行训练;在无监督接触预测任务中,其性能优于规模相近的 ESM2-3B。在此类表征的基础上,AtlasFold 可预测全原子蛋白质结构,并在基于 PLM 的折叠模型中实现了当前最先进的准确率。通过对 AtlasFold 进行蛋白质复合物预测微调,得到 AtlasFold-Multimer(AtlasFold-M);其抗体–抗原预测性能与 AlphaFold3 和 ESMFold2 相当。这种蛋白质特异性折叠架构使 AtlasFold 和 AtlasFold-M 能够实现快速且高效利用内存的推理。通过依据 MIT 许可证发布训练代码和数据、各阶段检查点以及模型权重,我们为推进基于 PLM 的蛋白质结构预测提供了基础。
韩国科学技术院(KAIST)
摘要
信息/历史
指标
数据/代码
预览 PDF
摘要
在进化序列上训练的蛋白质语言模型(PLM)能够学习编码蛋白质结构的表征,从而无需多序列比对(MSA)即可直接预测结构。本文提出 Atlas 模型系列,这是一套开放且可训练的系统,涵盖蛋白质语言建模、单体折叠和蛋白质复合物预测。AtlasLM-3B 是一个规模为 30 亿参数的语言模型,采用掩码语言建模方法,在约 15.6 亿条序列(包括宏基因组数据)上进行训练;在无监督接触预测方面,其性能优于规模相近的 ESM2-3B。在这些表征的基础上,AtlasFold 可预测全原子蛋白质结构,并在基于 PLM 的折叠模型中达到当前最先进的精度。通过对 AtlasFold 进行蛋白质复合物预测微调,研究人员构建了 AtlasFold-Multimer(AtlasFold-M),其抗体—抗原预测性能可与 AlphaFold3 和 ESMFold2 相媲美。这种蛋白质特异性折叠架构使 AtlasFold 和 AtlasFold-M 能够实现快速且高效的内存推理。我们依据 MIT 许可证发布训练代码和数据、各阶段检查点以及模型权重,为推进基于 PLM 的蛋白质结构预测提供了基础。
利益冲突声明
脚注
https://github.com/SeonghwanSeo/atlasfold
已声明的资助方信息
国家信息技术产业振兴院,
https://ror.org/026v53e29
,PJT-26-100009
版权
本预印本的。
该预印本依据
CC-BY 4.0 国际许可
公开发布。
返回顶部
上一篇
发布于 2026 年 9 月 7 日。
下载 PDF
数据/代码
电子邮件
感谢您有兴趣传播 bioRxiv 的相关信息。
您的电子邮件地址
*
您的姓名
*
发送至
*
请输入多个地址,每行一个,或使用逗号分隔。
您将要发送以下内容
AtlasFold:利用宏基因组规模语言模型进行蛋白质结构预测
邮件主题
(您的姓名)从 bioRxiv 网站转发了一个页面给您
邮件正文
(您的姓名)认为您可能会对 bioRxiv 网站上的这一页面感兴趣。
您的个人留言
验证码
此问题用于确认您是真实访客,并防止自动垃圾邮件提交。
分享
AtlasFold:利用宏基因组规模语言模型进行蛋白质结构预测
Seonghwan Seo
、
Hyeongwoo Kim
、
Seokhyun Moon
、
Woo Youn Kim
、
KAIST 团队
bioRxiv
2026.09.04.749352;
doi:
https://doi.org/10.64898/2026.09.04.749352
分享本文:
复制
引用工具
AtlasFold:利用宏基因组规模语言模型进行蛋白质结构预测
Seonghwan Seo
、
Hyeongwoo Kim
、
Seokhyun Moon
、
Woo Youn Kim
、
KAIST 团队
bioRxiv
2026.09.04.749352;
doi:
https://doi.org/10.64898/2026.09.04.749352
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.04.749352v1?rss=1
🏷️ 蛋白质结构预测 蛋白质语言模型 宏基因组学 蛋白质复合物预测 深度学习