ProtAug:面向蛋白质序列预测任务的 pLM 引导数据增强的实证研究

root 提交于 周一, 07/13/2026 - 08:47
蛋白质语言模型(protein language models,pLMs)在蛋白质序列分析中展现出巨大潜力,然而,标注数据的稀缺性常常限制其微调效果。数据增强是一种很有前景的补救方法,但针对蛋白质序列增强策略的系统性评估仍然有限,而且数据增强在何种条件下能够带来下游收益尚未得到充分理解。本文系统研究了由 pLM 引导的、基于替换的数据增强方法在七项蛋白质预测任务中的表现。我们提出了 ProtAug,这是一个利用编码器式(ESM-2)和自回归式(ProtGPT2)pLMs 生成增强序列、并允许用户控制变异水平的框架。我们的研究聚焦于四个问题:(Q1)与更简单的方法相比,由 pLM 合成的序列是否能够保留更多原始信号;(Q2)数据增强在多大程度上能够提升预测性能;(Q3)不同变异水平如何影响不同任务与模型中的下游准确率;以及(Q4)生物学合理性是否是实现性能提升的必要条件。实验结果表明:(1)ProtAug_Esm 通常比简单替换更能保留基序和结构相似性,且往往可与同源序列检索相媲美;(2)数据增强能够带来稳定但依赖于任务的性能提升,其中 ProtAug_Esm 在 10% 变异水平下于 7 项任务中的 5 项取得了最佳或次佳表现;(3)总体而言,低到中等变异水平(2–30%)效果最佳,尽管高变异增强也可能有利于某些与结构相关的任务;(4)生物学合理性的必要性取决于任务与变异水平——在低到中等变异水平下,语义保持与性能相关,而在高变异水平下观察到的泛化能力提升则表明,驱动性能增益的也可能是正则化效应,而非标签保持。

ProtAug:面向蛋白质序列预测任务的 pLM 引导数据增强的实证研究 | bioRxiv 跳到主要内容 首页 关于 提交 提醒 / RSS 搜索此关键词 高级搜索 最新结果 ProtAug:面向蛋白质序列预测任务的 pLM 引导数据增强的实证研究 查看 ORCID 主页 Zhuoyang Chen , Ruoqi Wang , 查看 ORCID 主页 Qiong Luo doi: https://doi.org/10.64898/2026.07.10.737545 Zhuoyang Chen 1 香港科技大学(广州); 在 Google Scholar 上查找此作者 在 PubMed 上查找此作者 在持有人为作者/资助方,其已授予 bioRxiv 永久展示该预印本的许可。 本文采用 CC-BY 4.0 国际许可协议 。 返回顶部 上一页 下一页 发表于 2026 年 7 月 11 日。 下载 PDF 通过电子邮件分享 感谢您传播 bioRxiv 的内容。 的身份。 您的电子邮件 * 您的姓名 * 发送至 * 可在每一行单独填写多个地址,或用逗号分隔。 您将通过电子邮件发送以下内容 ProtAug:面向蛋白质序列预测任务的 pLM 引导数据增强的实证研究 Zhuoyang Chen , Ruoqi Wang , Qiong Luo bioRxiv 2026.07.10.737545; doi: https://doi.org/10.64898/2026.07.10.737545 分享此文章: 复制 引文工具 ProtAug:面向蛋白质序列预测任务的 pLM 引导数据增强的实证研究 Zhuoyang Chen , Ruoqi Wang , Qiong Luo bioRxiv 2026.07.10.737545; doi: https://doi.org/10.64898/2026.07.10.737545


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.10.737545v1?rss=1

🏷️ 蛋白质语言模型 数据增强 蛋白质序列预测 ESM-2 ProtGPT2 下游任务评估