Vipsania:无监督深度基因识别

root 提交于 周一, 08/31/2026 - 18:47
将蛋白质编码基因的结构注释扩展至所有真核生物基因组,仍是一项重大挑战。尽管近期的深度学习方法在无需 RNA-seq 数据或序列比对的情况下,其性能已可与基于证据的流程相媲美,但这些方法完全依赖监督学习。它们需要来自多样化基因组的大规模、高质量训练集,因此许多基部真核生物类群仍缺乏准确的从头基因预测软件。我们提出了 Vipsania,这是首个无监督深度基因预测软件。深度序列模型内部的可微隐马尔可夫层能够仅利用未经注释的基因组数据,学习预测基因结构。Vipsania 针对几乎所有真核生物进行预训练,并可在目标基因组上进行无需监督的微调。总体而言,在大多数类群中,其准确性高于监督式方法,并且避免了监督模型在面对进化距离较远的目标基因组时所出现的准确性下降。Vipsania 能够适应非标准遗传密码,并为无偏、泛真核生物基因组注释提供一种快速且高度通用的工具。源代码可从 https://github.com/gaius-augustus/vipsania 获取。

Mario Stanke 的 ORCID 记录

摘要

信息/历史

指标

补充材料

数据/代码

预览 PDF

摘要

将蛋白质编码基因的结构注释扩展至所有真核生物基因组,仍然是一项重大挑战。尽管近期的深度学习方法在无需 RNA-seq 数据或序列比对的情况下,其性能已可与基于证据的流程相媲美,但这些方法完全依赖监督学习。它们需要来自多样化基因组的大规模、高质量训练集,导致许多真核生物基部分支仍缺乏准确的从头基因预测软件。我们提出了 Vipsania,这是首个无监督深度基因预测软件。深度序列模型内部的可微隐马尔可夫层能够仅从未经注释的基因组中学习预测基因结构。Vipsania 已针对几乎所有真核生物进行预训练,并且无需监督即可在目标基因组上进行微调。在大多数分类群中,其平均准确性高于监督学习方法,同时避免了监督模型在面对亲缘关系较远的目标基因组时所出现的准确性下降。Vipsania 能够适应非标准遗传密码,并为无偏的泛真核基因组注释提供一种快速且高度通用的工具。源代码可见于 https://github.com/gaius-augustus/vipsania

利益冲突声明

脚注

https://github.com/gaius-augustus/vipsania

已声明的资助方信息

德国研究基金会

,STA 1009/17-1

版权

本预印本的。

该预印本依据

CC-BY 4.0 国际许可协议

提供。

返回顶部

上一页

下一页

发布于 2026 年 8 月 30 日。

下载 PDF

补充材料

数据/代码

电子邮件

感谢您有兴趣传播 bioRxiv 的相关信息。

您的电子邮件地址

*

您的姓名

*

发送至

*

请输入多个地址,每行一个,或使用逗号分隔。

您将要发送的内容如下

Vipsania:无监督深度基因预测

邮件主题

(您的姓名)已将 bioRxiv 上的一个页面转发给您

邮件正文

(您的姓名)认为您可能会对 bioRxiv 网站上的此页面感兴趣。

您的个人留言

验证码

此问题用于测试您是否为人类访客,并防止自动垃圾信息提交。

分享

Vipsania:无监督深度基因预测

Richard Krieg,

Felix Becker,

Stepan Saenko,

Joscha Diehl,

Mario Stanke

bioRxiv

2026.08.26.747235;

doi:

https://doi.org/10.64898/2026.08.26.747235

分享本文:

复制

引文工具

Vipsania:无监督深度基因预测

Richard Krieg,

Felix Becker,

Stepan Saenko,

Joscha Diehl,

Mario Stanke

bioRxiv

2026.08.26.747235;

doi:

https://doi.org/10.64898/2026.08.26.747235


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.26.747235v1?rss=1

🏷️ 无监督学习 深度学习 基因识别 真核生物基因组注释 隐马尔可夫模型