- 3 次围观
同义密码子的选择会影响 mRNA 稳定性、翻译和折叠,而密码子语言模型(cLM)也越来越多地被报道能够从序列中读出这些生物学信息。然而,当真实信号相对于混杂信号而言非常微弱时,标准评估协议可能制造出报告中的性能提升,而非对其进行测量;我们表明,这正是 cLM 在同义变体预测任务中所发生的情况。 在随机划分下,密码子优势十分显著:分词方式带来的差距为 +2.3~14.3 个百分点(pp),预训练密码子模型相对于最强的蛋白质模型(ESM-1b)领先 +8.0 个百分点,相对于 ESM-2 的领先幅度最高可达 +10.0 个百分点。我们发现,这些数字反映的是测量方式的性质,而非模型本身的性质。一个记忆化基线的表现超过了所有神经模型;在按基因留出评估下,这种优势会崩塌;唯一残存的余量也会在六种合理的探针默认设置中消解;而此前似乎证实真实信号存在的“同义词随机化下降”,在合并分析下本身也只是方差(0.3 个百分点,p = 0.49)。在控制泄漏并采用合并统计的评估中,没有任何优势能够存续。 我们发布了 CodonBench,这是一个控制泄漏的基准,并配有一种涌现式审计级联,同时刻画了伪影如何在流程的每一个步骤中累积。可能确实存在一个微弱信号(I({sigma};Y|A) {approx} 0.04 比特),但以当前样本量尚无法可靠检测到;我们进一步明确了检测这一信号所需满足的条件。
泄漏控制基准表明,同义变体预测中密码子语言模型的表观优势是评估伪影 | bioRxiv
跳转至主要内容 首页 关于 投稿 提醒 / RSS 搜索此关键词 高级搜索 最新结果
泄漏控制基准表明,同义变体预测中密码子语言模型的表观优势是评估伪影
Yuanqing Liang, Weimin Zhu, Huiying Liang, Xiaoyong Pan
doi: https://doi.org/10.64898/2026.08.12.744371
Yuanqing Liang 1 上海交通大学生物医学工程学院,中国上海 200240;
在 Google Scholar 上查找该作者 在 PubMed 上查找该作者 在持有人为作者/资助方,其已授予 bioRxiv 永久展示该预印本的许可。 本文依据 CC-BY 4.0 国际许可协议 开放提供。
返回顶部 上一篇
发表于 2026 年 8 月 14 日。
下载 PDF 电子邮件
感谢您有兴趣帮助传播 bioRxiv。
您的电子邮件 * 您的姓名 * 发送至 * 请输入多个地址,每行一个,或用逗号分隔。
您将要通过电子邮件发送以下内容 泄漏控制基准表明,同义变体预测中密码子语言模型的表观优势是评估伪影
消息主题 (您的姓名)已从 bioRxiv 转发了一个页面给您
消息正文 (您的姓名)认为您可能希望查看 bioRxiv 网站上的此页面。
您的个人消息
验证码
此问题用于测试您是否为人类访客,并防止自动化垃圾信息提交。
分享
泄漏控制基准表明,同义变体预测中密码子语言模型的表观优势是评估伪影
Yuanqing Liang, Weimin Zhu, Huiying Liang, Xiaoyong Pan
bioRxiv 2026.08.12.744371; doi: https://doi.org/10.64898/2026.08.12.744371
分享本文: 复制
引文工具
泄漏控制基准表明,同义变体预测中密码子语言模型的表观优势是评估伪影
Yuanqing Liang, Weimin Zhu, Huiying Liang, Xiaoyong Pan
bioRxiv 2026.08.12.744371; doi: https://doi.org/10.64898/2026.08.12.744371
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.12.744371v1?rss=1
🏷️ 密码子语言模型 同义变异预测 信息泄漏控制 基准评测 预训练模型 统计伪影