一个控制信息泄漏的基准表明:密码子语言模型在同义变异预测中的表面优势是评估伪影

root 提交于 周六, 08/15/2026 - 16:47
同义密码子的选择会影响 mRNA 稳定性、翻译和折叠,而密码子语言模型(cLM)也越来越多地被报道能够从序列中读出这些生物学信息。然而,当真实信号相对于混杂信号而言非常微弱时,标准评估协议可能制造出报告中的性能提升,而非对其进行测量;我们表明,这正是 cLM 在同义变体预测任务中所发生的情况。 在随机划分下,密码子优势十分显著:分词方式带来的差距为 +2.3~14.3 个百分点(pp),预训练密码子模型相对于最强的蛋白质模型(ESM-1b)领先 +8.0 个百分点,相对于 ESM-2 的领先幅度最高可达 +10.0 个百分点。我们发现,这些数字反映的是测量方式的性质,而非模型本身的性质。一个记忆化基线的表现超过了所有神经模型;在按基因留出评估下,这种优势会崩塌;唯一残存的余量也会在六种合理的探针默认设置中消解;而此前似乎证实真实信号存在的“同义词随机化下降”,在合并分析下本身也只是方差(0.3 个百分点,p = 0.49)。在控制泄漏并采用合并统计的评估中,没有任何优势能够存续。 我们发布了 CodonBench,这是一个控制泄漏的基准,并配有一种涌现式审计级联,同时刻画了伪影如何在流程的每一个步骤中累积。可能确实存在一个微弱信号(I({sigma};Y|A) {approx} 0.04 比特),但以当前样本量尚无法可靠检测到;我们进一步明确了检测这一信号所需满足的条件。

泄漏控制基准表明,同义变体预测中密码子语言模型的表观优势是评估伪影 | bioRxiv

跳转至主要内容 首页 关于 投稿 提醒 / RSS 搜索此关键词 高级搜索 最新结果

泄漏控制基准表明,同义变体预测中密码子语言模型的表观优势是评估伪影

Yuanqing Liang, Weimin Zhu, Huiying Liang, Xiaoyong Pan

doi: https://doi.org/10.64898/2026.08.12.744371

Yuanqing Liang 1 上海交通大学生物医学工程学院,中国上海 200240;

在 Google Scholar 上查找该作者 在 PubMed 上查找该作者 在持有人为作者/资助方,其已授予 bioRxiv 永久展示该预印本的许可。 本文依据 CC-BY 4.0 国际许可协议 开放提供。

返回顶部 上一篇

发表于 2026 年 8 月 14 日。

下载 PDF 电子邮件

感谢您有兴趣帮助传播 bioRxiv。

您的电子邮件 * 您的姓名 * 发送至 * 请输入多个地址,每行一个,或用逗号分隔。

您将要通过电子邮件发送以下内容 泄漏控制基准表明,同义变体预测中密码子语言模型的表观优势是评估伪影

消息主题 (您的姓名)已从 bioRxiv 转发了一个页面给您

消息正文 (您的姓名)认为您可能希望查看 bioRxiv 网站上的此页面。

您的个人消息

验证码

此问题用于测试您是否为人类访客,并防止自动化垃圾信息提交。

分享

泄漏控制基准表明,同义变体预测中密码子语言模型的表观优势是评估伪影

Yuanqing Liang, Weimin Zhu, Huiying Liang, Xiaoyong Pan

bioRxiv 2026.08.12.744371; doi: https://doi.org/10.64898/2026.08.12.744371

分享本文: 复制

引文工具

泄漏控制基准表明,同义变体预测中密码子语言模型的表观优势是评估伪影

Yuanqing Liang, Weimin Zhu, Huiying Liang, Xiaoyong Pan

bioRxiv 2026.08.12.744371; doi: https://doi.org/10.64898/2026.08.12.744371


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.12.744371v1?rss=1

🏷️ 密码子语言模型 同义变异预测 信息泄漏控制 基准评测 预训练模型 统计伪影