代谢物跨蛋白质家族形成一个全球互联的化学网络

root 提交于 周二, 08/18/2026 - 10:47
代谢物通常被视为单个蛋白质的底物、产物、辅因子或调节因子,而在许多蛋白质家族中反复出现的代谢物则常常被认为是具有广泛非特异性结合能力的配体。在此,我们分析了 989,058 个 BioLiP2 蛋白质-配体结合位点,并将其中 929,546 个位点归类至 ECOD v295 同源组,以量化配体特异性、跨折叠分散性、结构广度以及代谢物介导的蛋白质家族空间连通性。许多古老代谢物优先占据其对应的结构组,这表明广泛的进化再利用可以与局部结构识别并存。 在排除元素金属、BioLiP 潜在伪影/双重用途配体以及重原子数少于 6 的代谢物之后,32 种古老代谢物平均每种占据 185.38 个 ECOD F-group,而 2,540 种经映射和过滤的非古老代谢物平均仅占据 6.32 个 F-group——前者富集了 29.35 倍(bootstrap 95% CI,18.66–43.46)。完整的 40 种古老代谢物网络将全部 6,798 个相关 F-group 连接成一个单一的巨型连通分量(GCC)。即使在严格过滤之后,所有 3,135 个与古老代谢物相关的 F-group 仍然保持在同一个 GCC 中。保持度分布不变的构型模型随机化以及最大度截断分析表明,这种连通性源于代谢物结合的广泛且反复出现的分布,而不是依赖于少数极端枢纽或某种特殊的高阶拓扑结构。 古老代谢物网络与经过滤的非古老代谢物网络之间的差异不能用代谢物大小来解释,而通用结晶添加剂则倾向于占据更小的口袋。这些结果表明,有限的古老化学组成建立了一个全局连通的蛋白质家族架构,后续的代谢物多样化在保留其基本组织形式的同时对其进行了扩展。

代谢物通常被视为单个蛋白质的底物、产物、辅因子或调节因子,而在许多蛋白质家族中反复出现的代谢物则常被认为是具有广泛结合倾向的“泛结合体”。在本研究中,我们分析了 989,058 个 BioLiP2 蛋白质-配体结合位点,并将其中 929,546 个位点归属于 ECOD v295 同源组,以量化配体特异性、跨折叠分散性、结构广度以及代谢物介导的蛋白质家族空间连通性。许多古老代谢物优先占据其对应的同源结构组,表明广泛的进化重复利用可以与局部结构辨别性并存。

在排除元素金属、BioLiP 中潜在人工产物/双重用途配体以及重原子数少于 6 的代谢物后,32 种古老代谢物平均每种代谢物占据 185.38 个 ECOD F-group,而 2,540 种已映射且经过过滤的非古老代谢物平均仅占据 6.32 个 F-group——富集倍数达到 29.35 倍(bootstrap 95% CI,18.66–43.46)。由全部 40 种古老代谢物构成的完整网络将其相关的 6,798 个 F-group 全部连接为一个单一的巨型连通分量(GCC)。即使在严格过滤之后,所有与古老代谢物相关的 3,135 个 F-group 仍然保留在同一个 GCC 中。保持度分布的构型模型随机化以及最大度截断分析表明,这种连通性源于代谢物结合位点的广泛且重复出现的分布,而非依赖于少数极端枢纽,或某种特殊的高阶拓扑结构。古老网络与经过过滤的非古老网络之间的差异并不能用代谢物大小来解释,而通用结晶添加剂则优先占据较小的结合口袋。这些结果表明,有限的古老化学组成建立了一种全局连通的蛋白质家族架构,随后代谢物多样化在保留其基本组织形式的同时对其进行了扩展。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.11.744260v1?rss=1

🏷️ 代谢物网络 蛋白质家族 配体结合位点 结构生物学 进化再利用