量化抗糖尿病肽预测中的来源—功能鸿沟:考虑同源性的评估与 ADP-Hybrid 基线

由 root 提交于 周五, 10/02/2026 - 14:47
抗糖尿病肽(antidiabetic peptides,ADPs)是具有治疗意义的短生物活性序列,基于序列的分类器可用于优先筛选实验候选对象。只有当分类器的准确性能够迁移到未见过的序列时,它才具有实际价值;而这取决于基准数据集的构建与划分方式。我们将此类分类器所接受评估的数据与其拟预测功能之间的距离称为“来源—功能鸿沟”(provenance-to-function gap),并对其进行量化。我们依据一种按同源肽分组、而非随机拆分肽序列的评估方案,重新评估了 Basith 等人构建的双层 ADP 基准数据集。在 877 条 ADP 中,有 218 条可通过精确子串包含关系归属于某一前体蛋白;在这一子集中,第二层标签与前体身份完全一致,不存在例外:全部 140 条人胰岛素片段均标记为 1 型,全部 76 条牛乳蛋白片段均标记为 2 型。分类准确性随其与训练集的序列同一性变化:当同一性低于 50% 时,马修斯相关系数(MCC)为 0.39–0.43;当同一性介于 70% 和 90% 之间时,MCC 升至 0.92–0.96;仅凭肽长度,在留出数据上即可达到 0.619 的 MCC。对另外 16 个肽基准数据集进行审查显示,这种耦合关系并非该资源所独有:在 14 个可检验的数据集中,有 11 个数据集中的片段家族共享同一标签的频率高于随机水平,而另外 3 个则不存在这种现象,因此这一性质具有普遍性,但并非无一例外。 在相同数据划分上重建已发表的模型架构表明,其相对于单一分类器的优势取决于数据划分方式:在随机划分下该优势存在,而在将同源序列分离后则消失。ADP-Hybrid 为每一层分别构建一个树集成分类器;在第 1 层上,其 MCC 达到 0.843,与已发表的 0.841 相当,同时推理吞吐量提高了 21–38 倍;在第 2 层上,其 MCC 为 0.801,而已发表结果为 0.858。我们公开了能够揭示上述性质的评估方案及对照实验。

量化抗糖尿病肽预测中的来源—功能鸿沟:同源性感知评估与 ADP-Hybrid 基线模型 | bioRxiv

跳转至主要内容

首页

关于

投稿

提醒 / RSS

搜索此关键词

高级搜索

最新结果

量化抗糖尿病肽预测中的来源—功能鸿沟:同源性感知评估与 ADP-Hybrid 基线模型

Ariful Islam 、 Md. Faruk Hosen 、 Md. Abul Basar 、 Mohammad Sarwar Hossain Mollah 、 Muhammad Shahin Uddin

doi: https://doi.org/10.64898/2026.09.25.754557

Ariful Islam 1 达法迪尔国际大学;

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Md. Faruk Hosen 2 贝格姆·罗凯亚大学;

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

通讯作者:

faruk{at}cse.brur.ac.bd

Md. Abul Basar 3 国家纺织工程与研究院;

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Mohammad Sarwar Hossain Mollah 1 达法迪尔国际大学;

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Muhammad Shahin Uddin 4 马瓦拉·巴沙尼科技大学

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

摘要

信息/历史

指标

预览 PDF

摘要

抗糖尿病肽(ADP)是具有治疗价值的短生物活性序列,基于序列的分类器可用于优先筛选实验候选物。只有当分类器的准确性能够迁移到未见过的序列时,其才具有实际价值;而这一点取决于基准数据集的构建与划分方式。我们将此类分类器的评分对象与其旨在预测的功能之间的距离定义为“来源—功能鸿沟”,并对其进行量化。我们依据将同源肽分组而非随机拆分的方案,重新评估了 Basith 等人构建的双层 ADP 基准数据集。在 877 条 ADP 中,有 218 条可通过精确的子串包含关系归属于某一前体蛋白;在这一子集中,第二层标签与前体身份完全一致:全部 140 条人胰岛素片段均被标记为 1 型,全部 76 条牛乳蛋白片段均被标记为 2 型,无一例外。准确率与样本同训练集之间的身份一致性呈同步变化:当序列一致性低于 50% 时,马修斯相关系数(MCC)为 0.39–0.43;在 70%–90% 之间时,MCC 升至 0.92–0.96;仅凭肽长度在留出数据上即可达到 0.619 的 MCC。对另外 16 个肽基准数据集进行审计显示,这种耦合关系并非该资源所独有:在 14 个可检验数据集中,有 11 个数据集中的片段家族共享同一标签的频率高于随机水平,另有 3 个数据集并非如此,因此这一属性具有普遍性,但并非普适存在。在完全相同的数据划分上重建已发表的模型架构后发现,其相对于单一分类器的优势取决于数据划分方式:在随机划分下该优势存在,而在将同源序列分离后则消失。ADP-Hybrid 采用每一层一个树集成分类器,在第 1 层上达到 0.843 的 MCC,而已发表模型为 0.841;其推理吞吐量提高了 21–38 倍。在第 2 层上,ADP-Hybrid 的 MCC 为 0.801,而已发表模型为 0.858。我们公开了能够揭示这些属性的评估方案与对照实验。

利益冲突声明

版权

本预印本的。

本文依据以下许可协议提供:

CC-BY 4.0 国际许可协议。

返回顶部

上一项

下一项

发布于 2026 年 10 月 1 日。

下载 PDF

电子邮件

感谢您有意帮助传播 bioRxiv 上的内容。

身份。

您的电子邮件地址

*

您的姓名

*

发送至

*

请输入多个地址,每行一个,或使用逗号分隔。

您将要发送以下内容

量化抗糖尿病肽预测中的来源—功能鸿沟:同源性感知评估与 ADP-Hybrid 基线模型

(您的姓名)已从 bioRxiv 网站转发了一个页面给您

邮件正文

(您的姓名)认为您可能希望查看 bioRxiv 网站上的此页面。

您的个人留言

验证码

此问题用于测试您是否为人类访客,并防止自动垃圾信息提交。

分享

量化抗糖尿病肽预测中的来源—功能鸿沟:同源性感知评估与 ADP-Hybrid 基线模型

Ariful Islam 、 Md. Faruk Hosen 、 Md. Abul Basar 、 Mohammad Sarwar Hossain Mollah 、 Muhammad Shahin Uddin

bioRxiv 2026.09.25.754557; doi: https://doi.org/10.64898/2026.09.25.754557

分享本文:

复制

引用工具

量化抗糖尿病肽预测中的来源—功能鸿沟:同源性感知评估与 ADP-Hybrid 基线模型

Ariful Islam 、 Md. Faruk Hosen 、 Md. Abul Basar 、 Mohammad Sarwar Hossain Mollah 、 Muhammad Shahin Uddin

bioRxiv 2026.09.25.754557; doi: https://doi.org/10.64898/2026.09.25.754557


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.25.754557v1?rss=1

🏷️ 抗糖尿病肽 肽分类器 同源性评估 数据集偏倚 机器学习基准 生物活性肽