预训练增强了 GeneUnet 对百万碱基级基因表达的预测能力

root 提交于 周三, 08/19/2026 - 14:47
从 DNA 序列预测跨多样基因组轨道的基因表达,对于理解基因调控和解释非编码变异至关重要。现有监督方法仅限于少数物种,且未能利用保守的调控机制;而 DNA 基础模型虽然能够捕获跨物种信息,但仍受限于千碱基级的上下文范围,无法满足该任务需求。在此,我们提出 GB.GeneUnet,这是一种具有 8.37 亿参数、基于 Transformer 的 U-Net 模型,在 OpenGenome2 的多物种基因组数据上使用 6 万亿 token 进行了预训练,将基因组上下文扩展至 1 Mb,并且相较于 GeneMoE——一种在相同数据上预训练、模型规模相近的初步 MoE Transformer 基线——在推理速度上最高提升 100 倍。经针对基因表达预测任务微调后,GB.GeneUnet 在 524 kb 上下文的 Borzoi 基准测试中达到了当前最优性能,并在 1 Mb 上下文下取得了与 AlphaGenome 相当的性能,同时仅需更轻量的微调流程。综上,这些结果建立了一个可扩展框架,将多物种预训练与超长上下文基因表达建模联系起来。

从跨多样化基因组轨道的 DNA 序列预测基因表达,对于理解基因调控和解释非编码变异至关重要。现有的监督方法仅限于少数物种,且未能利用保守的调控机制;而 DNA 基础模型虽然能够捕捉跨物种信息,但仍受限于千碱基尺度的上下文,这不足以胜任该任务。本文提出 GB.GeneUnet,这是一种具有 8.37 亿参数、基于 Transformer 的 U-Net 模型,在 OpenGenome2 的多物种基因组数据上以 6 万亿 token 进行预训练,将基因组上下文扩展至 1 Mb,并且相较于 GeneMoE——一种初步的、模型规模相近且在相同数据上预训练的 MoE Transformer 基线——在推理速度上实现了最高 100$\times$ 的提升。针对基因表达预测任务进行微调后,GB.GeneUnet 在 524 kb 上下文的 Borzoi 基准测试中达到了当前最优性能,并在 1 Mb 上下文下取得了与 AlphaGenome 相当的性能,同时仅需更为轻量的微调流程。综上,这些结果确立了一个可扩展框架,将多物种预训练与超长上下文的基因表达建模连接起来。

感谢您有兴趣帮助传播 bioRxiv 上的研究成果。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.13.744387v1?rss=1

🏷️ 基因表达预测 基因组预训练 Transformer U-Net 多物种基因组 长程调控建模