使用 AbSLang 从大型序列数据库中快速检索结构相似的抗体

root 提交于 周三, 08/12/2026 - 14:47
抗体治疗性药物发现的第一步涉及鉴定具有理想结合特性的序列。寻找这些先导分子的一种方式是搜索大型序列数据库。由于数据库规模庞大,当前方法依赖于生殖系或互补决定区(CDR)序列同一性,从而忽略了那些序列差异较大但结构相似的抗体,而这类抗体可能具有相同的结合特性。为了解决这一问题,我们提出了 AbSLang,这是一种采用对比学习方法训练的、用于成对 CDR RMSD 预测的模型。我们证明,AbSLang 的准确性可与使用最先进模型进行显式结构预测后再进行精确 RMSD 计算相媲美。在此模型基础上,我们实现了 AbSLang-search,这是一条用于从大型序列数据库中检索结构相似抗体的流程。AbSLang-search 具有极高的计算效率,能够在不到 2 秒的时间内搜索包含 1000 万条序列的数据集。

抗体治疗发现的第一步涉及鉴定具有理想结合特性的序列。寻找这些先导分子的一种方法是搜索大型序列数据库。由于数据库规模庞大,当前方法依赖于种系基因或互补决定区(CDR)序列一致性,从而忽略了那些序列差异较大但结构相似的抗体,而这类抗体可能具有相同的结合特性。为了解决这一问题,我们提出了 AbSLang,这是一种采用对比学习方法训练、用于成对 CDR 均方根偏差(RMSD)预测的模型。我们证明,AbSLang 的准确性可与利用最先进模型进行显式结构预测后得到的精确 RMSD 计算相媲美。在此模型基础上,我们实现了 AbSLang-search,这是一条用于从大型序列数据库中检索结构相似抗体的流程。AbSLang-search 具有极高的计算效率,能够在不到 2 秒的时间内搜索包含 1000 万条序列的数据集。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.05.742817v1?rss=1

🏷️ 抗体检索 对比学习 结构相似性 CDR-RMSD预测 序列数据库