广泛使用的数据库受到污染,削弱了基于 rRNA 的宏基因组和宏转录组分类学注释的准确性

root 提交于 周四, 07/23/2026 - 18:47
宏基因组和宏转录组数据集的分类注释通常依赖于将小亚基(SSU)rRNA reads 比对到带注释的参考数据库。然而,广泛使用的 SSU 数据库,包括 SILVA、GTDB、Eukaryome 以及 SortMeRNA 随附分发的数据库,均受到大亚基(LSU)rRNA 序列污染。即使较低水平的 LSU 污染,也可能导致大量 LSU reads 被错误识别为 SSU,并对后续的分类学归属产生严重影响。 这一问题可以通过严格去除用于分类注释的数据库中的 LSU 序列来避免,而我们已在 KSGP 4.0 中完成了这一工作。另一种方法是,使用一个经过精心整理且不含 LSU 污染的小型 SSU 数据库来进行初始 SSU read 筛选。我们结合这两种方法,并利用一个河口沉积物的宏转录组数据集进行了说明。在不清理数据库的情况下,来源于 LSU 的 reads 可占所谓 SSU 序列的一半,并被归属于少数几个表面上占优势但实际上是伪影的分类单元。数据库清理能够消除这一问题;此外,我们还提供了一个脚本 `total_rnaseq`,用于采用该方法对总 RNASeq 或宏基因组数据进行注释。与 SILVA 数据库相比,KSGP 4.0 数据库显著改善了古菌的注释效果,并分别对真核生物和细菌带来了中等程度和较小程度的改进。

宏基因组和宏转录组数据集的分类注释通常依赖于将小亚基(SSU)rRNA 读段比对到带注释的参考数据库上。然而,广泛使用的 SSU 数据库,包括 SILVA、GTDB、Eukaryome 以及随 SortMeRNA 分发的数据库,都受到大亚基(LSU)rRNA 序列的污染。即使是低水平的 LSU 污染,也可能导致大量 LSU 读段被错误识别为 SSU,并对后续的分类学指派产生严重后果。通过严格去除用于分类注释的数据库中的 LSU 序列,可以避免这一问题;我们已在 KSGP 4.0 中完成了这项工作。或者,也可以使用一个经过精心整理且不含 LSU 污染的小型 SSU 数据库来进行初始的 SSU 读段筛选。我们结合这两种方法,利用一个河口沉积物的宏转录组数据集进行了说明。在未清理数据库的情况下,来源于 LSU 的读段可占所谓 SSU 序列的一半,并被指派给少数几个看似占优势但实际上是伪影的分类群。数据库清理消除了这一问题;我们还提供了一个脚本 `total_rnaseq`,用于采用该方法对总 RNASeq 或宏基因组数据进行注释。与 SILVA 数据库相比,KSGP 4.0 数据库对古菌的注释有显著改进,对真核生物和细菌的注释则分别有中等和较小幅度的改进。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.22.739903v1?rss=1

🏷️ 宏基因组 宏转录组 rRNA数据库污染 分类学注释 SSU/LSU鉴定 参考数据库清理