SPA-C:一种利用 Hi-C 和深度学习准确进行基因组组装的混合工具

root 提交于 周一, 06/22/2026 - 20:47
基因组组装是一条计算流程,旨在利用短测序读段重建染色体。组装完成后,在搭架步骤中,连续序列(contig)被排列为染色体长度的序列。Hi-C 作为一种提供基因组不同区域之间远程连锁信息的技术,已在近年来的大型测序项目中得到广泛应用,并且通常是正确排序 contig 所必需的。针对这一任务,研究人员已开发出多种自动化工具,这些工具主要采用统计方法或深度学习方法。 统计方法将二维 Hi-C 矩阵概括为序列间的接触密度,因此忽略了其中具有信息价值的视觉模式。现有唯一的深度学习工具采用基于 Transformer 的计算机视觉模型来纠正组装结果。该工具已在多个物种上进行训练,并直接使用 Hi-C 矩阵。然而,它作为搭架流程中的补充步骤引入了额外的计算时间,而且其训练所使用的数据集可能包含标注错误,从而可能导致次优结果。 我们提出了 SPA-C,这是一种结合两类方法优势的混合流程。连锁关系预测由一个轻量级的基于卷积神经网络(CNN)的模型完成,而搭架序列的生成则采用图求解算法。通过对输入数据的设计,该模型能够利用小尺度、局部的 Hi-C 接触矩阵,同时纠正组装中的错误并连接 contig。对于可能诱发错误预测的低复杂度区域,我们借助外部工具进行处理,从而提高了生成组装结果的整体准确性。在涵盖六种不同基因组和四项标准指标的基准测试中,SPA-C 在四种最先进方法中的全部四种对比方法上均表现更优,同时实现了相当的端到端计算时间。Python 和 Bash 脚本可在 GitHub(https://github.com/SPA-C/SPA-C.git)和 Zenodo(https://doi.org/10.5281/zenodo.19000361)获取。

本网站正在使用一项安全服务来保护自身免受在线攻击。您刚刚执行的操作触发了该安全解决方案。可能导致此拦截的行为有多种,包括提交某些特定单词或短语、SQL 命令或格式错误的数据。

您可以向网站所有者发送电子邮件,告知其您已被拦截。请在邮件中说明该页面出现时您正在进行的操作,并附上本页底部显示的 Cloudflare Ray ID。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.06.16.732382v1?rss=1

🏷️ 基因组组装 Hi-C 深度学习 染色体搭架 卷积神经网络