TDKC(目标蒸馏 K-mer 分类器):面向目标病原体诊断的超快速且内存高效的序列分类

root 提交于 周日, 06/07/2026 - 18:47
宏基因组测序能够在事先未知致病因子的情况下,从临床样本中鉴定病原体。然而,随着测序流程扩展到可同时处理数千个多重化样本,针对庞大参考数据库对这些样本进行分类构成了显著的计算瓶颈。此外,大规模应用(如公共序列存储库的筛查)在计算上仍然具有挑战性。现有宏基因组分类器是为全分类单元分类而设计的,其目标是识别样本中的所有生物。然而,许多诊断应用关注的是检测一组特定的、具有临床相关性的病原体。这一约束条件可被利用,以显著降低计算成本。在此,我们提出 TDKC(Target Distilled K-mer Classifier,一种目标蒸馏 k-mer 分类器),这是一种用于靶向宏基因组分类的方法。TDKC 通过从全分类单元参考数据库中蒸馏出目标特异性 k-mer 来构建紧凑索引。在对临床样本进行分类时,TDKC 相较于基于每条读取的全分类单元和靶向分类器(Kraken2、Centrifuger、CLARK),内存使用减少 16.9–33.6 倍,速度提高 5.2–34.3 倍,同时保持了较高的灵敏度和较低的假阳性率。与基于 sketch 的分析器 Sylph 相比,TDKC 仍快 4.2 倍,并且内存使用减少 8.5 倍。TDKC 还支持跨超过 300 万个源登录号的逐 k-mer 登录号追踪,用于下游亚型分析,以及对细菌、古菌和病毒的域水平检测。通过将索引缩减为仅包含感兴趣病原体,TDKC 使大规模靶向病原体检测成为可能。

宏基因组测序能够在无需预先知晓致病因子的情况下,从临床样本中鉴定病原体。然而,随着测序流程扩展到可同时处理数千个多重化样本,针对海量参考数据库对这些样本进行分类已成为一个显著的计算瓶颈。此外,诸如筛查公共序列存储库等大规模应用在计算上仍然具有挑战性。现有的宏基因组分类器是为全分类单元分类而设计的,其目标是识别样本中的所有生物体。然而,许多诊断应用关注的是检测一组特定的、具有临床相关性的病原体。这一约束可被利用以显著降低计算成本。

本文提出了 TDKC(Target Distilled K-mer Classifier,目标蒸馏 K-mer 分类器),一种用于靶向宏基因组分类的方法。TDKC 通过从全分类单元参考数据库中蒸馏出目标特异性 k-mer 来构建紧凑索引。在对临床样本进行分类时,与基于单条读段的全分类单元分类器和靶向分类器(Kraken2、Centrifuger、CLARK)相比,TDKC 在保持高灵敏度和低假阳性率的同时,内存使用减少了 16.9–33.6 倍,速度提高了 5.2–34.3 倍。与基于 sketch 的分析器 Sylph 相比,TDKC 仍然快 4.2 倍,且内存使用减少了 8.5 倍。TDKC 还支持对超过 300 万个源登录号进行逐 k-mer 的登录号追踪,以用于下游亚型分析,并支持对细菌、古菌和病毒进行域水平检测。通过将索引缩减为仅包含感兴趣的病原体,TDKC 使大规模靶向病原体检测成为可能。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.06.05.730319v1?rss=1

🏷️ 宏基因组分类 病原体检测 k-mer分类器 序列分类 内存高效计算 靶向诊断