一个动态目标:非平稳选择决定病毒适应度的无监督预测

由 root 提交于 周四, 10/01/2026 - 02:47
预测突变如何改变病毒适应度,是基因组监测和疫苗设计的核心;然而,支撑最准确变异效应预测器的监督表型数据,对于大多数新出现的病原体而言都无法获得。我们探讨:仅利用序列、序列的进化历史和结构信息,无标签评分究竟能够达到何种程度。我们构建了一个模块化、完全无监督的流程,用于估计若干具有可解释性的指标(内在复制适应度、抗原逃逸和实际增长),并允许每一项指标由多个估计器生成,从而使估计器本身成为一种可检验的建模选择。在 ProteinGym 的 21 项病毒深度突变扫描实验中对内在适应度项进行基准评估后,我们发现,一个拥有 6.5 亿参数的单序列蛋白质语言模型对病毒突变适应度的预测较弱且表现不均一(平均 Spearman 相关系数为 0.15);相比之下,一个简单的位点独立序列比对模型使该数值提高了一倍以上(达到 0.39,并在 21 项实验中的 17 项上表现更优),其中最大幅度的提升出现在语言模型表现失效的抗原表面蛋白上。然而,在 186 项非病毒 ProteinGym 实验中,结果顺序发生逆转:语言模型反而优于比对模型,这表明其弱点局限于模型训练数据中代表性不足的病毒家族。以比对为条件的语言模型(MSA Transformer、Tranception)能够恢复这一准确性,但并未明确超过简单的序列比对模型,因此决定性特征是家族序列比对,而非模型规模或架构。我们的核心结论具有进化学意义。利用带有采样时间信息的 SARS-CoV-2 刺突蛋白和流感 H3N2 血凝素样本,我们证明,序列比对所覆盖的时期本身就是决定预测准确性的一个关键且具有病毒特异性的因素。这一现象源于非平稳选择:位点特异性的氨基酸偏好会随时间发生漂移,其中刺突蛋白的变化在 Omicron 出现时骤然发生,而 H3N2 血凝素的变化则较为渐进。一个系统发育突变—选择估计器并未达到成本低得多的比对模型的表现;在匹配数据上,其性能显著低于后者。因此,无监督病毒适应度预测既是一个进化问题,也是一个建模问题。

Matthieu Vilain 的 ORCID 记录

摘要

信息/历史

指标

补充材料

数据/代码

预览 PDF

摘要

预测突变如何改变病毒适合度,对于基因组监测和疫苗设计至关重要;然而,支撑最准确变异效应预测器的监督表型数据,对于大多数新出现的病原体而言都无法获得。我们探讨了仅利用序列、序列的进化历史和结构进行无标签评分所能达到的程度。我们构建了一套模块化、完全无监督的流程,用于估计若干具有可解释性的项(内在复制适合度、抗原逃逸和实际增长),并允许每一项由多个估计器生成,从而使估计器持有人为作者/资助者,其已授予 bioRxiv 一项许可,使其得以永久展示该预印本。

该预印本依据 CC-BY-NC-ND 4.0 国际许可协议提供。

返回顶部

上一篇

下一篇

发布于 2026 年 9 月 30 日。

下载 PDF

补充材料

数据/代码

电子邮件

感谢您有兴趣传播 bioRxiv 的内容。

您的电子邮件地址

*

您的姓名

*

发送至

*

请输入多个地址,每行一个,或使用逗号分隔。

您即将发送以下内容

一个不断变化的目标:非平稳选择决定病毒适合度的无监督预测

邮件主题

(您的姓名)已从 bioRxiv 网站转发了一个页面给您

邮件正文

(您的姓名)认为您可能会对 bioRxiv 网站上的这一页面感兴趣。

您的个人留言

验证码

此问题用于测试您是否为人类访客,并防止自动垃圾邮件提交。

分享

一个不断变化的目标:非平稳选择决定病毒适合度的无监督预测

Stephane Aris-Brosou

,

Matthieu Vilain

bioRxiv 2026.09.17.752359; doi: https://doi.org/10.64898/2026.09.17.752359

分享本文:

复制

引用工具

一个不断变化的目标:非平稳选择决定病毒适合度的无监督预测

Stephane Aris-Brosou

,

Matthieu Vilain

bioRxiv 2026.09.17.752359; doi: https://doi.org/10.64898/2026.09.17.752359


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.17.752359v1?rss=1

🏷️ 病毒适应度预测 非平稳选择 蛋白质语言模型 序列比对 病毒进化 无监督学习