- 1次围观
研究动机:前体微RNA(pre-miRNA)预测用于对基因组发夹结构进行优先级排序,以辅助miRNA注释。现有预测器基于不同的物种集合、负样本集和数据划分进行训练与评估,因此其报告的性能提升难以直接比较。 研究结果:我们提出了pre-miRBench,这是一个包含7,056个以经过整理的pre-miRNA基因座为中心的200 nt窗口,以及70,560个带有预测发夹结构的基因组负样本的基准数据集,涵盖71种动物,并在每个数据划分中固定阳性样本与阴性样本的比例为1:10。四个测试集根据训练集中是否包含相关物种和miRNA家族进行交叉划分:已知物种/已知家族、已知物种/留出家族、留出物种/已知家族,以及留出物种/留出家族。我们在相同的基准划分下重新训练了六种已发表的pre-miRNA预测器(DeepMir、deepMiRGene、dnnPreMiR、mirDNN、miRe2e和MuStARD),并将其与pre-miRBench模型一同进行评估。pre-miRBench模型是利用Agentomics开发的由三个神经网络组成的集成模型;Agentomics是一种用于生物医学机器学习的自主大型语言模型(LLM)智能体系统。pre-miRBench模型在四个测试集上的平均平均精度(AP)最高(0.9809;dnnPreMiR为0.9719),并在其中三个测试集中取得最佳表现。两个留出物种为家鸡(Gallus gallus)和黑腹果蝇(Drosophila melanogaster);物种与家族联合留出测试集包含69个阳性样本和690个阴性样本。在物种与家族联合留出测试集中,dnnPreMiR取得了最高AP(0.9677,而pre-miRBench为0.9659)。AP差值(pre-miRBench减去dnnPreMiR)为−0.0018,配对自助法95%置信区间为−0.0445至0.0341。pre-miRBench为物种留出和miRNA家族留出建立了统一的评估框架,并为未来的性能比较提供了可复现的参考模型。 数据与实现:可复现的源代码发布于https://github.com/dimostzim/pre-miRBench。pre-miRBench及六种重新训练的预测器的数据集、训练模型权重、记录级预测结果、评估指标和物种面板元数据发布于https://zenodo.org/records/22813044。
pre-miRBench:用于动物前体微小RNA预测的多物种基准与参考模型 | bioRxiv
跳转至主要内容 主页 关于 投稿 提醒 / RSS 搜索该关键词 高级搜索 最新结果
# pre-miRBench:用于动物前体微小RNA预测的多物种基准与参考模型
查看 ORCID 主页 Dimosthenis Tzimotoudis, 查看 ORCID 主页 Vasileios Klearchos Chatzitolios, 查看 ORCID 主页 Panagiotis Alexiou, 查看 ORCID 主页 Georgios Georgakilas
doi: https://doi.org/10.64898/2026.09.30.755660
Dimosthenis Tzimotoudis¹ ¹马耳他大学分子医学与生物样本库中心; 在 Google Scholar 中查找该作者 在 PubMed 中查找该作者 在本站搜索该作者 Dimosthenis Tzimotoudis 的 ORCID 记录
Vasileios Klearchos Chatzitolios² ²希腊雅典国立卡波季斯特里安大学信息学与电信系; 在 Google Scholar 中查找该作者 在 PubMed 中查找该作者 在本站搜索该作者 Vasileios Klearchos Chatzitolios 的 ORCID 记录
Panagiotis Alexiou¹ ¹马耳他大学分子医学与生物样本库中心; 在 Google Scholar 中查找该作者 在 PubMed 中查找该作者 在本站搜索该作者 Panagiotis Alexiou 的 ORCID 记录
Georgios Georgakilas³ ³雅典娜研究中心信息管理系统研究所,15125,希腊马鲁西 在 Google Scholar 中查找该作者 在 PubMed 中查找该作者 在本站搜索该作者 Georgios Georgakilas 的 ORCID 记录
通讯作者: george.georgakilas{at}gmail.com
## 摘要
信息/历史 指标 预览 PDF
## 摘要
**研究动机:** 前体微小RNA(pre-miRNA)预测用于筛选基因组发夹结构,以确定其优先用于miRNA注释。已发表的预测器采用不同的物种集合、阴性数据集和数据划分方式进行训练与评估,因此其报告的性能提升难以直接比较。
**研究结果:** 我们提出了 pre-miRBench,这是一个包含7,056个长度为200 nt、以经整理的pre-miRNA基因座为中心的窗口,以及70,560个基因组阴性样本的基准数据集。这些样本来自71种动物,并包含预测得到的发夹结构;每个数据划分中的正负样本比例固定为1∶10。四个测试集分别考察训练数据中是否包含相关物种和miRNA家族:已知物种/已知家族、已知物种/留出家族、留出物种/已知家族,以及留出物种/留出家族。我们在相同的基准划分下重新训练了6种已发表的pre-miRNA预测器(DeepMir、deepMiRGene、dnnPreMiR、mirDNN、miRe2e和MuStARD),并将其与pre-miRBench模型一同进行评估。pre-miRBench模型由Agentomics开发,是由3个神经网络组成的集成模型;Agentomics是一种面向生物医学机器学习的自主大型语言模型代理系统。pre-miRBench模型在4个测试集上的平均平均精确率(AP)最高(0.9809;dnnPreMiR为0.9719),并在其中3个测试中取得领先。两个留出物种为鸡(Gallus gallus)和黑腹果蝇(Drosophila melanogaster);物种与家族联合留出的测试集包含69个正样本和690个负样本。在物种与家族联合留出测试中,dnnPreMiR的AP最高(0.9677,而pre-miRBench为0.9659)。AP差值(pre-miRBench减去dnnPreMiR)为−0.0018,配对自助法95%置信区间为−0.0445至0.0341。pre-miRBench为物种留出和miRNA家族留出建立了统一的评估体系,并为未来的比较研究提供了可复现的参考模型。
**可用性与实现:** 可复现的源代码发布于:https://github.com/dimostzim/pre-miRBench。pre-miRBench及重新训练的6种预测器的数据集、训练后的模型权重、记录级预测结果、评估指标和物种面板元数据发布于:https://zenodo.org/records/22813044。
## 利益冲突声明
## 资助信息声明
HORIZON-WIDERA-2022, BioGeMT(项目编号:101086768)。 Xjenza Malta和科学技术研究委员会(TÜBİTAK)
## 版权
本预印本的。
本预印本依据 CC-BY 4.0国际许可协议 提供。
返回顶部 上一篇 下一篇
发表于2026年10月6日。
下载 PDF 电子邮件
感谢您有兴趣传播bioRxiv上的内容。
**您的电子邮件地址 *
您的姓名 *
发送至 *
请输入多个地址,每行一个或以逗号分隔。
您将要发送的内容如下: pre-miRBench:用于动物前体微小RNA预测的多物种基准与参考模型
邮件主题 (您的姓名)转发了bioRxiv网站上的一个页面
邮件正文 (您的姓名)认为您可能会对bioRxiv网站上的该页面感兴趣。
您的个人留言
验证码
此问题用于测试您是否为人类访问者,并防止自动垃圾邮件提交。
分享
# pre-miRBench:用于动物前体微小RNA预测的多物种基准与参考模型
Dimosthenis Tzimotoudis, Vasileios Klearchos Chatzitolios, Panagiotis Alexiou, Georgios Georgakilas
bioRxiv 2026.09.30.755660; doi: https://doi.org/10.64898/2026.09.30.755660
分享本文: 复制
引用工具
pre-miRBench:用于动物前体微小RNA预测的多物种基准与参考模型
Dimosthenis Tzimotoudis, Vasileios Klearchos Chatzitolios, Panagiotis Alexiou, Georgios Georgakilas
bioRxiv 2026.09.30.755660; doi: https://doi.org/10.64898/2026.09.30.755660
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.30.755660v1?rss=1
🏷️ 前体微小RNA预测 多物种基准数据集 深度学习 机器学习模型评估 miRNA注释 跨物种泛化