Anniemap:用于病毒短读比对的向量搜索

root 提交于 周五, 08/28/2026 - 22:47
背景:将测序读段比对到参考基因组的过程是基因组分析中的基础步骤,支撑着从变异检测到病原体监测等多种任务。然而,在病毒基因组学中,这一问题变得显著更具挑战性:病毒序列通常在宿主主导的样本中丰度较低,并且由于快速突变和群体异质性,往往与现有参考序列存在明显差异。这些特征降低了传统 seed-and-extend(种子延伸)比对工具的有效性,因为这类方法通常依赖较长的精确或近似精确匹配来锚定比对。即使是轻微的序列分歧或测序错误也可能破坏这些种子,尤其对于短读段而言,从而导致比对遗漏。在这种情形下,核心挑战是在高分歧条件下保持稳健比对,同时不牺牲效率。 结果:我们提出了 Anniemap,一种基于向量搜索的病毒短读段序列比对方法。Anniemap 将读段和参考序列表示为二进制向量,并利用 Facebook AI Similarity Search(FAISS)进行近似最近邻搜索,以高效识别候选比对位置。我们使用模拟和真实测序数据,在多种病毒基因组和不同读段长度条件下,将 Anniemap 与成熟的比对工具 Bowtie2 和 BWA-MEM2 进行了比较。在几乎所有评估场景中,Anniemap 均表现出更高的灵敏度和吞吐量,其中在高分歧基因组上的灵敏度提升最为显著,例如丙型肝炎病毒(HCV)和人类免疫缺陷病毒(HIV)。 结论:Anniemap 通过度量向量相似性,而非依赖较长的精确种子匹配,从而对测序错误和基因组突变具有更强的鲁棒性。这一特性对于病毒基因组尤为有利,因为显著的序列分歧在其中较为常见。未来仍需进一步研究,以将基于向量的读段比对搜索高效扩展到病毒基因组之外。

背景:将测序读段比对到参考基因组的过程是基因组分析中的基础步骤,支撑着从变异检测到病原体监测等多项任务。然而,在病毒基因组学中,这一问题会显著更具挑战性:病毒序列通常在以宿主为主的样本中丰度较低,并且由于快速突变和群体异质性,往往与现有参考序列存在明显差异。这些特征降低了传统 seed-and-extend(种子延伸)比对器的有效性,因为这类方法通常依赖较长的精确或近精确匹配作为比对锚点。即使是适度的序列差异或测序错误,也可能破坏这类种子,尤其对于短读段而言,从而导致比对遗漏。在这种情境下,核心挑战是在高差异度条件下保持稳健比对,同时又不牺牲效率。

结果:我们提出了 Anniemap,一种基于向量搜索的病毒短读段序列比对方法。Anniemap 将读段和参考序列表示为二进制向量,并利用 Facebook AI Similarity Search(FAISS)执行近似最近邻搜索,以高效识别候选映射位置。我们使用模拟和真实测序数据,在一组多样化的病毒基因组和不同读段长度条件下,将 Anniemap 与成熟的比对工具 Bowtie2 和 BWA-MEM2 进行了比较。在几乎所有评估场景中,Anniemap 都表现出更高的灵敏度和吞吐量;其中,对高差异性基因组的灵敏度提升最为显著,例如丙型肝炎病毒(HCV)和人类免疫缺陷病毒(HIV)。

结论:通过度量向量相似性而非依赖较长的精确种子匹配,Anniemap 对测序错误和基因组突变具有更强的鲁棒性。这一特性对于病毒基因组尤为有利,因为显著的序列差异在该类基因组中十分常见。未来仍需进一步研究,以高效地将基于向量的搜索扩展到病毒基因组之外的读段比对任务。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.26.747390v1?rss=1

🏷️ 病毒短读比对 向量搜索 近似最近邻 FAISS 高分歧基因组