- 3 次围观
在蛋白质序列暮光区(20–35% 序列一致性)内,蛋白质序列相似性的评估仍然具有挑战性,而传统方法在这一范围内往往失效。在本研究中,我们评估了四种蛋白质语言模型——ESM-1b、ESM-2、ProtT5 和 ProstT5——的均值池化嵌入能否在不进行序列比对的情况下估计成对结构相似性。基准数据集包含 20,445 对 PISCES 蛋白质对,其序列一致性均小于等于 30%,代表了蛋白质序列暮光区,并以 TM-align 计算得到的 TMmin 作为结构真值。蛋白质嵌入通过余弦相似性、基于欧几里得距离和曼哈顿距离导出的相似性、RBF 核以及点积进行比较。在这些相似性度量中,余弦相似性在全部四种模型上均表现最佳。此外,ProstT5 与 TMmin 的 Spearman 相关性最高,其后依次为 ESM-2、ProtT5 和 ESM-1b,而这四种蛋白质语言模型整体上均优于 BLASTP。进一步地,对于序列一致性最低的蛋白质对,蛋白质语言模型嵌入的优势最为显著。ProstT5 在区分结构相似与结构不相似的蛋白质对方面也表现最佳。此外,在残基级嵌入生成与存储的计算需求方面,它在相似性表现与计算成本之间提供了良好的平衡。总体而言,这些发现支持将蛋白质语言模型嵌入作为一种有效的无比对方法,用于检测暮光区蛋白质之间的结构关系。
评估蛋白质语言模型嵌入在蛋白质序列“暮光区”中表征结构相似性的能力 | bioRxiv
跳转至主要内容 首页 关于 提交 提醒 / RSS 搜索此关键词 高级搜索 新结果
评估蛋白质语言模型嵌入在蛋白质序列“暮光区”中表征结构相似性的能力
SHIVARAM DANWADA, PRISCILLA UDOMPRASERT, NILANJANA RAYCHAWDHARY, CHERYL D SEALS, Lei Wu, Sutanu Bhattacharya
doi: https://doi.org/10.64898/2026.07.31.742099
SHIVARAM DANWADA 1 奥持有人为作者/资助方,其已授予 bioRxiv 永久展示该预印本的许可。 本文依据 CC-BY 4.0 国际许可协议公开提供。
返回顶部 上一页 下一页
发表于 2026 年 7 月 31 日。
下载 PDF 电子邮件
感谢您有兴趣帮助传播 bioRxiv。 您的电子邮件 * 您的姓名 * 发送至 * 请输入多个地址,每行一个,或用逗号分隔。
您将要通过电子邮件发送以下内容 评估蛋白质语言模型嵌入在蛋白质序列“暮光区”中表征结构相似性的能力
消息主题 (您的姓名)已从 bioRxiv 向您转发了一个页面
消息正文 (您的姓名)认为您可能希望查看 bioRxiv 网站上的此页面。
您的个人消息
验证码 此问题用于测试您是否为人类访问者,并防止自动化垃圾信息提交。
分享
评估蛋白质语言模型嵌入在蛋白质序列“暮光区”中表征结构相似性的能力
SHIVARAM DANWADA, PRISCILLA UDOMPRASERT, NILANJANA RAYCHAWDHARY, CHERYL D SEALS, Lei Wu, Sutanu Bhattacharya
bioRxiv 2026.07.31.742099; doi: https://doi.org/10.64898/2026.07.31.742099
分享本文: 复制
引文工具
评估蛋白质语言模型嵌入在蛋白质序列“暮光区”中表征结构相似性的能力
SHIVARAM DANWADA, PRISCILLA UDOMPRASERT, NILANJANA RAYCHAWDHARY, CHERYL D SEALS, Lei Wu, Sutanu Bhattacharya
bioRxiv 2026.07.31.742099; doi: https://doi.org/10.64898/2026.07.31.742099
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.31.742099v1?rss=1
🏷️ 蛋白质语言模型 序列暮光区 结构相似性 无比对方法 蛋白质嵌入