评估非线性模型在数据驱动的肽段-谱图匹配重评分中的应用

root 提交于 周五, 07/17/2026 - 12:47
在基于质谱(MS)的蛋白质组学中,计算工具将采集到的串联质谱谱图与序列数据库中的肽段进行匹配。机器学习正日益通过肽段-谱图匹配(PSM)重评分来支持这一任务;在该过程中,分类器——通常是线性半监督模型——对初始匹配得分进行优化。然而,Mokapot 允许用户在复杂度逐步增加的不同机器学习算法中进行选择,从默认的线性支持向量机(LSVM)到随机森林和 XGBoost。本文采用诱捕(entrapment)方法评估这种复杂度增加对 PSM 鉴定以及估计假发现率(FDR)准确性的影响。我们表明,尽管更复杂的模型在固定 FDR 阈值下能够提高已鉴定 PSM 的数量,但这种增益反映的是对来自目标蛋白质组数据库的随机匹配的偏倚,而非真实鉴定。事实上,对于最复杂的模型,诱捕 FDR 达到 6.3%,而非估计的 1% 诱饵 FDR。因此,这种偏倚会导致过于乐观的 FDR 估计,表明在 PSM 重评分中,模型复杂度必须与这种过拟合风险之间进行谨慎权衡。

评估在肽段-谱图匹配的数据驱动重评分中使用非线性模型 | bioRxiv

跳转至主要内容

首页 关于 投稿 提醒 / RSS 搜索此关键词 高级搜索 新结果

评估在肽段-谱图匹配的数据驱动重评分中使用非线性模型

查看 ORCID 个人资料 Alireza Nameni, 查看 ORCID 个人资料 Arthur Declercq, 查看 ORCID 个人资料 Ralf Gabriels, 查看 ORCID 个人资料 Sven Degroeve, 查看 ORCID 个人资料 Lennart Martens, 查看 ORCID 个人资料 Robbin Bouwmeester

doi: https://doi.org/10.64898/2026.07.10.737772

Alireza Nameni VIB-UGent 在 Google Scholar 上查找该作者 在 PubMed 上查找该作者 在持有人为作者/资助方,其已授予 bioRxiv 永久展示该预印本的许可。 本文依据 CC-BY 4.0 国际许可协议 公开提供。

返回顶部 上一页 下一页

发布于 2026 年 7 月 16 日。 下载 PDF 补充材料 数据/代码 电子邮件

感谢您有兴趣传播 bioRxiv 的内容。

您的电子邮件 *

您的姓名 *

发送至 *

请输入多个地址,每行一个,或以逗号分隔。

您将通过电子邮件发送以下内容

评估在肽段-谱图匹配的数据驱动重评分中使用非线性模型

邮件主题

(您的姓名)已从 bioRxiv 转发一个页面给您

邮件正文

(您的姓名)认为您可能希望查看 bioRxiv 网站上的此页面。

您的个人留言

验证码

此问题用于测试您是否为人工访客,并防止自动化垃圾信息提交。

分享

评估在肽段-谱图匹配的数据驱动重评分中使用非线性模型

Alireza Nameni, Arthur Declercq, Ralf Gabriels, Sven Degroeve, Lennart Martens, Robbin Bouwmeester

bioRxiv 2026.07.10.737772; doi: https://doi.org/10.64898/2026.07.10.737772

分享本文: 复制

引文工具

评估在肽段-谱图匹配的数据驱动重评分中使用非线性模型

Alireza Nameni, Arthur Declercq, Ralf Gabriels, Sven Degroeve, Lennart Martens, Robbin Bouwmeester

bioRxiv 2026.07.10.737772; doi: https://doi.org/10.64898/2026.07.10.737772


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.10.737772v1?rss=1

🏷️ 蛋白质组学 质谱分析 肽段-谱图匹配 机器学习重评分 假发现率 模型复杂度