冻结蛋白质基础模型嵌入提升抗体-抗原ΔΔG排序效果

root 提交于 周三, 07/15/2026 - 18:47
我们研究了这样一个问题:AINN-P1 的表征——这一蛋白质基础模型是在数千万条天然蛋白质序列上以自回归方式训练得到的——是否能够迁移到根据结合亲和力对抗体-抗原配对进行排序的任务中。 我们将亲和力成熟表述为一个基于结合自由能变化(ΔΔG)的学习排序问题,并比较了两类方法:一类是从头开始端到端训练的任务特定序列模型,另一类是构建在冻结的 AINN-P1 嵌入之上的轻量级下游头模型;所有方法均在完全相同的五折交叉验证协议下进行评估。对冻结嵌入使用正则化线性探针,已经超越了从头训练的基线;而经过优化的轻量级下游头则将平均 Spearman 秩相关系数从 0.42 提升至 0.53——相对提升约 28%——同时训练仅需数秒,且无需对基础模型进行任何微调。 由于仅线性探针就已超过了完全训练的端到端基线,因此性能增益应归因于表征质量,而非下游模型容量的增加。这些结果表明,在抗体工程中的亲和力排序任务上,冻结的基础模型嵌入可作为一种强有力且数据高效的默认方案,并为预期将被任务自适应微调进一步超越的性能设定了一个保守的下界。

lurong.pan{at}ainnocence.com

摘要 信息/历史 指标 预览 PDF

摘要 我们研究了来自 AINN-P1 的表征——一种在数千万条天然蛋白质序列上以自回归方式训练的蛋白质基础模型——是否能够迁移到按结合亲和力对抗体–抗原配对进行排序的任务中。我们将亲和力成熟表述为一个基于结合自由能变化(ΔΔG)的学习排序问题,在完全相同的五折交叉验证方案下,比较了一个从头开始端到端训练的任务特异性序列模型,与构建在冻结的 AINN-P1 嵌入之上的轻量级下游头部模型。结果表明,对冻结嵌入使用正则化线性探针,已经超过了从头训练的基线模型;而经过优化的轻量级头部模型则将平均 Spearman 秩相关系数从 0.42 提升至 0.53——相对提升约 28%——同时训练仅需数秒,且无需对基础模型进行任何微调。由于仅线性探针就已超过完全训练的端到端基线,因此这种增益应归因于表征质量,而非下游模型容量的增加。这些结果表明,在抗体工程中的亲和力排序任务上,冻结的基础模型嵌入可作为一种强有力且数据高效的默认方案,并建立了一个保守的下界,而任务自适应微调预计将超越这一水平。

利益冲突声明 所有作者均隶属于 Ainnocence, Inc.。该公司开发了持有人为作者/资助方,其已授予 bioRxiv 永久展示该预印本的许可。 本文依据 CC-BY-NC-ND 4.0 国际许可协议 提供。

返回顶部 上一页 下一页

发表于 2026 年 7 月 14 日。 下载 PDF 电子邮件

您的电子邮件 *

您的姓名 *

发送至 *

请输入多个地址,每行一个,或用逗号分隔。

您将通过电子邮件发送以下内容 冻结的蛋白质基础模型嵌入提升抗体–抗原 ΔΔG 排序

消息主题 (您的姓名)已从 bioRxiv 向您转发了一个页面

消息正文 (您的姓名)认为您会希望查看 bioRxiv 网站上的这个页面。

您的个人消息

验证码 此问题用于测试您是否为人工访问者,并防止自动化垃圾信息提交。

分享 冻结的蛋白质基础模型嵌入提升抗体–抗原 ΔΔG 排序

Roger Wang , Kevin Jin , Lurong Pan

bioRxiv 2026.07.13.738250; doi: https://doi.org/10.64898/2026.07.13.738250

分享本文: 复制

引文工具 冻结的蛋白质基础模型嵌入提升抗体–抗原 ΔΔG 排序

Roger Wang , Kevin Jin , Lurong Pan

bioRxiv 2026.07.13.738250; doi: https://doi.org/10.64898/2026.07.13.738250


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.13.738250v1?rss=1

🏷️ 抗体-抗原结合 结合自由能变化 蛋白质基础模型 冻结嵌入 亲和力排序