- 2 次围观
基于微生物组的生物标志物已被提出用于结直肠癌(CRC)检测,但在不知道分类学分析流程是否能够在人体样本中可靠地检测和量化这些候选类群的情况下,对其进行解释往往是不充分的。现有的真实基准研究通常依赖于简化群落,无法保留临床粪便宏基因组的生物学和技术复杂性。我们假设,尤其与早期疾病相关的弱CRC关联信号,可能会因分析上未能检出而被遗漏,而非由于生物学上不存在。我们开发了一种计算机模拟加标框架,将CRC相关信号嵌入临床粪便宏基因组中。我们将10个分类单元分别以六个比例(0.01–5%)引入,或作为等权重群落以七个总比例(0.01–10%;每个分类单元的有效比例为0.001–1%)引入,从310个样本中生成了5,770个加标宏基因组。随后使用Kraken2/Bracken和MetaPhlAn 4对这些宏基因组进行分析,以量化检出情况、丰度准确性、假阳性信号、生物标志物恢复以及与已知真实值的一致性。恢复效果强烈依赖于分析流程、分类单元、丰度和临床背景。在0.01%时,四个分类单元——F. nucleatum、P. micra、P. stomatis和P. intermedia——在Kraken2/Bracken下于85–90%的样本中表现出良好的恢复;而在MetaPhlAn 4下,没有任何分类单元在至少50%的样本中达到良好恢复。更高的低丰度恢复伴随着更广泛的易受伪影影响的背景(分别占非目标分类单元的54.9%与0.5%)。易受伪影影响的分类单元分别占富集的非目标差异丰度调用的96.3%和100%。基于加标的伪影排除在存在此类伪影的情况下显著减少了非目标检出,而丰度响应建模则在两种评估配置中对系统性丰度失真提供了概念验证式校正。总体而言,所评估的分析配置表明,已知的低丰度CRC相关信号可能在完整的生物标志物发现流程中被遗漏或失真。分析上未能检出可能导致早期检测生物标志物被遗漏,而非表明其在生物学上不存在。重要的是,考虑伪影的过滤和丰度校正表明,这些局限性可以在一定程度上得到克服。分类学分析的改进或有助于使可靠的基于微生物组的CRC诊断更接近临床应用。
基于微生物组的生物标志物已被提出用于结直肠癌(CRC),然而,候选分类群往往是在不知道分类学分析流程能否在人体样本中可靠检测和定量这些分类群的情况下被解释的。现有的真实基准研究通常依赖于简化的群落,未能保留临床粪便宏基因组的生物学和技术复杂性。我们假设,尤其与早期疾病相关的弱CRC关联信号,可能因分析上的未恢复而被遗漏,而非由于生物学上的缺失。我们开发了一个体外计算(in silico)加标框架,将CRC相关信号嵌入临床粪便宏基因组中。单独引入十个分类群,设置六个比例(0.01–5%);或将其作为等权重群落引入,设置七个总比例(0.01–10%;每个分类群的有效比例为0.001–1%),由此从310个样本生成了5,770个加标宏基因组。随后使用Kraken2/Bracken和MetaPhlAn 4对这些宏基因组进行分析,以量化检测能力、丰度准确性、假阳性信号、生物标志物恢复情况,以及相对于已知真实值的校准表现。恢复情况强烈依赖于分析流程、分类群、丰度和临床背景。在0.01%时,四个分类群——F. nucleatum、P. micra、P. stomatis和P. intermedia——在Kraken2/Bracken下于85–90%的样本中表现出良好恢复,而在MetaPhlAn 4下,没有任何分类群在至少50%的样本中实现良好恢复。更高的低丰度恢复能力伴随着更广泛的易受伪影影响的背景(分别占非目标分类群的54.9%与0.5%)。易受伪影影响的分类群分别占富集的非目标差异丰度检出结果的96.3%和100%。基于加标推导的伪影排除在存在此类伪影时显著减少了非目标检出,而丰度响应建模则对两种评估配置中的系统性丰度失真提供了原理验证式的校正。总体而言,所评估的分析配置表明,在完整的生物标志物发现流程中,已知的低丰度CRC相关信号可能会被遗漏或扭曲。分析上的未恢复可能导致早期检测生物标志物被错过,而非表明其生物学缺失。重要的是,考虑伪影的过滤与丰度校准表明,这些限制可以在一定程度上得到克服。分类学分析的改进或有助于使可靠的基于微生物组的CRC诊断更接近临床应用。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.02.742082v1?rss=1
🏷️ 结直肠癌 微生物组生物标志物 计算机模拟加标 分类学检出 宏基因组分析