- 1次围观
内容形式:摘要译文
动机
从头基因组组装依赖于在复杂图结构中准确选择路径,然而,unitig 图中的分支点仍是产生歧义的主要来源。仅依据拓扑结构,多个延伸方向可能同样合理,但不同候选路径在序列层面的一致性尚未得到充分探索。
模型
我们提出 RASTRO,一种无需参考序列的框架,利用核苷酸序列信息对 unitig 分支点处的候选路径进行评分。RASTRO-S 采用样本特异性的 n-gram 模型,通过每碱基惊异度(bits-per-base surprisal)估计延伸的合理性;RASTRO-L 则使用预训练的 Evo2 DNA 语言模型,对路径进行自回归评分。两种方法均可直接在 unitig 图上运行,无需参考基因组或已组装的重叠群。为独立评估分支决策,我们开发了一种基于测序读段的验证策略,利用跨越图上下文与候选延伸之间连接处的边界 k-mer 进行验证。
结果
在 Logan 生成的 HIV-1 和 SARS-CoV-2 unitig 图上的实验表明,基于序列的模型能够与测序读段支持的选择实现较高程度的一致。在抽样的 20,000 个分支点中,HIV-1 有 15,319 个分支(76.6%)确定了唯一的读段支持选择,SARS-CoV-2 有 19,882 个分支(99.4%)确定了唯一的读段支持选择。随着上下文长度由 n = 5 增加至 n = 10,RASTRO-S 的一致率在 HIV-1 上由 54.1% 提升至 83.5%,在 SARS-CoV-2 上由 58.6% 提升至 76.4%。RASTRO-L 的性能也随上下文长度增加而提升,一致率分别达到 49.96% 和 49.25%。两种方法的表现均优于随机选择和最长延伸贪心基线。
结论
RASTRO 提供了一种高效且可解释的框架,利用原始读段证据而非重叠群层面的比对来评估 unitig 图中的歧义路径决策。结果表明,轻量级、样本自适应的序列模型有望改善基因组组装流程中的局部决策。
关键词:从头基因组组装 · Unitig图 · 分支点决策 · DNA语言模型 · k-mer验证
原文链接:https://www.biorxiv.org/content/10.64898/2026.09.28.754897v1?rss=1