用于环肽基序发现的优化多重环状序列比对

root 提交于 周一, 08/03/2026 - 06:47
头尾(H2T)环化肽正日益成为药物发现中的一种重要形式,其将高靶标亲和力与高选择性以及代谢稳定性结合于一体。由于其底层化学本质仍然是线性氨基酸链,因此其线性序列表征是当前推动从头肽设计的主流序列生成模型的原生输入格式(Slough et al., 2018;Rettie et al., 2025a;b)。要在这类候选分子文库中发现决定某一家族功能的保守基序,需要进行多序列比对(MSA)。由于环肽可以在任意残基处线性化,因此比对过程还必须额外求解每条序列的未知旋转,这就是多重环状序列比对(MCSA)问题。然而,现有领先的MCSA启发式方法(如 Ayad & Pissis, 2017)是针对基因组学场景(少量几十条长序列)进行调优的,而在环肽文库场景中(数百至数千条较短序列)会变得慢到难以实际应用。我们通过识别能够在保持比对质量的同时进行优化的机会来弥补这一差距,尤其是针对短序列输入定制的文库规模预设(算法细节见附录A),并增加了一个正交的多核与SIMD后端以进一步进行性能调优,从而在成对比较阶段实现接近线性的线程扩展。我们在一个由内部肽设计引擎生成的、包含1,000条长度为18且以致癌蛋白人源鼠双微体2同源蛋白(MDM2)为靶标的H2T环化肽文库上验证了该流程。在这一实际设置中,优化后的MCSA在保持与原始MCSA实现相同保真度的同时恢复了MDM2结合肽的潜在位置基序,而运行速度提高了650倍以上。因此,我们优化的MCSA工具使文库规模的环肽序列比对成为可能,并已在 https://github.com/IVB-Generative-Biology/mars-turbo 公开发布。

头尾(H2T)环化肽正日益成为药物发现中的一种重要模态,兼具高靶标亲和力与选择性以及代谢稳定性。由于其底层化学本质仍然是线性氨基酸链,其线性序列表征天然构成了当前推动从头肽设计的主流序列生成模型的输入格式(Slough et al., 2018;Rettie et al., 2025a;b)。要在此类候选分子文库中发现决定某一家族功能的保守基序,需要进行多重序列比对(MSA)。由于环肽可以在任意残基处线性化,因此比对还必须额外求解每条序列未知的旋转位置,这就是多重环状序列比对(MCSA)问题。然而,领先的MCSA启发式方法(如 Ayad & Pissis, 2017)是针对基因组学场景(少量数十条长序列)进行调优的,在环肽文库场景(数百至数千条较短序列)中会变得慢到难以实际应用。我们通过识别能够在保持比对质量的同时实现优化的机会来弥补这一空白,尤其是针对短序列输入定制的文库规模预设(算法细节见附录A),并进一步加入正交的多核与SIMD后端以进行性能调优,从而在成对比较阶段实现近线性的线程扩展。我们在一个由内部肽设计引擎生成的、针对致癌蛋白小鼠双微体2人同源物(MDM2)的1000条长度为18的H2T环化肽文库上验证了该流程。在这一实际设置下,优化后的MCSA在恢复MDM2结合肽的潜在位置基序时,与原始MCSA实现具有相同的保真度,但运行速度提高了650倍以上。因此,我们优化后的MCSA工具实现了文库规模的环肽序列比对,并已公开发布于 https://github.com/IVB-Generative-Biology/mars-turbo


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.28.741376v1?rss=1

🏷️ 环肽 多重序列比对 基序发现 算法优化 并行计算 药物设计