- 6 次围观
OrthoFinder 的全对全 DIAMOND 步骤在深层分类分化条件下会系统性地漏检单拷贝直系同源群(single-copy orthogroups, SC OGs):一个在严格限定的队列内能够被清晰回收的标记,当同一标记在门水平广泛范围的宏基因组组装基因组(metagenome-assembled genome, MAG)集合中进行搜索时,往往会被丢弃,因为即使底层直系同源物确实存在,成对序列相似性也会低于 DIAMOND 的检测阈值。其结果是产生有偏的缺失——保留下来的超级矩阵倾向于包含接近该队列的基因组,却丢失同一门内更深层、分化更大的边缘基因组。 我们描述了一种两阶段的队列-HMM 招募流程(首先基于队列比对为每个 OG 构建 profile HMM,随后使用 hmmsearch 对更广泛的蛋白质组集合进行搜索),并在此基础上增加了一个独立的、针对每个 OG 的基因树质量控制(QC)步骤。该步骤根据每个招募命中相对于队列最近共同祖先(most recent common ancestor, MRCA)后代集合的位置进行分类,并在超级矩阵拼接之前施加一个按 MAG 计算的旁系同源率过滤器。我们在三个分类等级上对该流程进行了表征。在门水平(Omnitrophota,97 个队列 OG,714 个 NCBI MAG)上,该招募过程能够恢复那些原本会被仅基于 OrthoFinder 的超级矩阵所丢弃的 MAG,而 QC 则识别出 2 个深层外围 MAG——这些高度分化的基因组,其每个 OG 的末端在重复分析中虽然属于直系同源物,却持续落在队列 MRCA 后代集合之外——并由按 MAG 过滤步骤将其移除。在科水平(Pelagibacteraceae,146 个队列 OG,366 个 NCBI MAG)以及属水平(Actinomarina,289 个队列 OG,23 个 NCBI MAG)上,按末端统计的旁系同源候选率降至 0.0%。 该流程解决了两种彼此独立的失效模式。队列内旁系同源密度会破坏队列步骤中严格单拷贝 OG 的发现(即科水平情形,在该情形下,每一个候选标记至少在一个队列物种中具有多个拷贝;宽松的队列判据提供了标记集合,而 HMM 招募则判别每个 NCBI MAG 应贡献哪一个拷贝)。DIAMOND 覆盖范围衰减会破坏对分化程度最高的 NCBI MAG 的 OG 归属(即门水平情形,在该情形下,成对相似性低于 DIAMOND 的检测阈值;HMM 招募能够恢复这些缺失项,而每个 OG 的 QC 步骤则过滤残余的旁系同源候选)。在属水平上,这两种失效模式均不活跃,OrthoFinder 可直接胜任;HMM 招募虽被执行,但未发现新的直系同源物。代码及各案例的数据产物已作为社区资源发布于 Zenodo(DOI 10.5281/zenodo.20422348)。
OrthoFinder 的全对全 DIAMOND 步骤在深层分类分化情况下会系统性遗漏单拷贝直系同源组(single-copy orthogroups, SC OGs):某个标记在一个定义严格的紧密队列内部可以被清晰恢复,但当针对门水平广覆盖的宏基因组组装基因组(metagenome-assembled genome, MAG)集合搜索同一标记时,即使底层直系同源基因确实存在,由于成对序列相似性低于 DIAMOND 的检测阈值,该标记仍会被丢弃。其结果是产生有偏倚的缺失——保留下来的超级矩阵更倾向于包含接近该队列的基因组,而丢失来自同一门中更深层、分化更大的边缘区域的基因组。
我们描述了一种两阶段的队列-HMM 招募流程(首先基于队列比对为每个 OG 构建 profile HMM,然后使用 hmmsearch 针对更广泛的蛋白质组集合进行搜索),随后进行一个独立的、针对每个 OG 的基因树质量控制(QC)步骤:该步骤根据每个招募命中相对于队列最近共同祖先(most recent common ancestor, MRCA)后代集合的位置进行分类,并在超级矩阵拼接之前施加一个按 MAG 计算的旁系同源率过滤。我们在三个分类等级上对该流程进行了表征。在门水平(Omnitrophota,97 个队列 OG,714 个 NCBI MAG)上,该招募流程恢复了那些本会被仅依赖 OrthoFinder 的超级矩阵所丢弃的 MAG,而 QC 识别出 2 个深层边缘 MAG——这些高度分化的基因组,其逐 OG 末端在重复分析中尽管属于直系同源基因,却反复落在队列 MRCA 后代集合之外——并由按 MAG 的过滤步骤将其去除。在科水平(Pelagibacteraceae,146 个队列 OG,366 个 NCBI MAG)和属水平(Actinomarina,289 个队列 OG,23 个 NCBI MAG)上,按末端统计的旁系同源候选率降至 0.0%。
该流程解决了两种相互独立的失效模式。队列内旁系同源密度会在队列步骤中破坏严格 SC OG 发现(即科等级情形,其中每个候选标记至少在一个队列物种中具有多个拷贝;放宽的队列判据提供了标记集合,而 HMM 招募则判别每个 NCBI MAG 应贡献哪一个拷贝)。DIAMOND 覆盖范围衰减会破坏对分化程度最高的 NCBI MAG 的 OG 赋值(即门等级情形,其中成对相似性低于 DIAMOND 的检测阈值;HMM 招募恢复了这些缺失项,而逐 OG 的 QC 步骤过滤掉残余的旁系同源候选)。在属等级中,这两种模式均未激活,OrthoFinder 可直接满足需求;HMM 招募虽然运行,但未发现新的直系同源基因。
代码及各案例的数据产物已作为社区资源发布于 Zenodo(DOI 10.5281/zenodo.20422348)。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.05.27.728348v1?rss=1
🏷️ 系统发育基因组学 隐马尔可夫模型 直系同源群 超级矩阵 宏基因组组装基因组 基因树质量控制