隐性且不断扩大的采样偏差扭曲了原核生物基因组数据库

由 root 提交于 周二, 10/06/2026 - 20:47
公共基因组集合支撑着我们对细菌多样性以及抗生素耐药性等性状分布的理解。其不断扩大的规模有望为微生物遗传变异提供日益完整的图景。然而,这些集合汇集了具有不同采样重点的研究,往往过度代表了某些特别受关注的近缘菌株亚群。这种偏差降低了有效信息量,而其对多样性估计以及进一步测序价值的影响,尚未得到充分量化。在此,我们表明,原核生物基因组集合中的采样偏差十分普遍,并且近年来日益加剧;该偏差会扭曲基因频率估计以及基因组多样性的表征。我们提出了一种基于系统发育关系检测并减少采样偏差的方法:将观测到的系统发育关系与随机采样预期进行比较。与去冗余和数据缩减方法不同,该方法能够考虑样本量因素。将该方法应用于NCBI基因组数据库中的402个原核生物物种后,我们的方法PhyloThin显示,有效样本数比实际样本数低41%。不同物种间的过度采样程度存在显著差异,这表明,仅凭基因组数量并不能完整衡量一个物种已被表征的程度。对过度采样进行校正后,可以揭示出比当前数据所显示的更高的基因组多样性,以及更多尚待发现的基因;同时还能改进基因频率估计,并为病原体监测和新型遗传功能的发现提供重要启示。

公共基因组集合是我们理解细菌多样性以及抗生素耐药性等性状分布的基础。其不断扩大的规模有望为微生物遗传变异提供日益完整的图景。然而,这些集合整合了具有不同采样重点的研究,往往过度代表了一些备受关注的近缘菌株亚群。由此产生的偏倚降低了有效信息量,而其对多样性估计以及进一步测序价值的影响,尚未得到充分量化。在此,我们表明,原核生物基因组集合中的采样偏倚广泛存在,并且近年来不断加剧,进而扭曲基因频率估计以及基因组多样性的表征。我们提出了一种基于系统发育关系检测并减少采样偏倚的方法:将实际系统发育关系与随机采样预期进行比较。与去冗余和数据缩减方法不同,该方法能够考虑样本量因素。将该方法应用于NCBI基因组数据库中的402个原核生物物种后,我们的PhyloThin方法显示,有效样本数比实际样本数低41%。不同物种间的过度采样程度存在显著差异,这表明,仅凭基因组数量并不能充分衡量一个物种已经得到表征的程度。校正过度采样后,结果显示基因组多样性更高,尚待发现的基因数量也多于当前数据所表明的水平;同时,基因频率估计得到改善,这对病原体监测和新型遗传功能的发现具有重要意义。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.29.755372v1?rss=1

🏷️ 原核生物基因组 采样偏差 系统发育分析 基因组多样性 基因组数据库 基因频率估计