PandaDock:具有柔性配体搜索与等变神经评分的开源分子对接平台

root 提交于 周五, 08/21/2026 - 08:47
我们提出了 PandaDock,这是一个开源分子对接平台,集成了柔性配体构象搜索与解析梯度、预计算亲和力网格引擎、用于诱导契合、金属配位和锚定对接的专用模块,以及一个经大规模训练的 SE(3) 等变图神经网络评分函数。 配体柔性被表示为扭转树,构象参数通过带有 Metropolis 接受准则的蒙特卡罗方法进行优化,并由 L-BFGS 进一步精化;其中旋转梯度通过 SO(3) 指数映射导数的闭式表达获得,而非通过有限差分近似。亲和力网格通过一种分块邻居选择方案构建,该方案是精确的,且比稠密评估快 5.6–9.7 倍;对于共享相同受体和位点的配体,这些网格可被缓存,从而将一个包含六个配体的系列的计算时间从 29.3 秒降至 10.4 秒。 在涵盖 14 个靶标家族的 814 个蛋白质-配体复合物上,PandaDock 在排序第 1 位时可在 33.7% 的案例中恢复出与晶体构象几何偏差在 2 埃以内的姿势;在返回的构象集合中,这一比例达到 57.0%。该 GNN 评分函数在来自 SAIR 的 741,706 个共折叠复合物上、采用靶标互斥划分进行训练,在 90,219 个保留复合物上的 Pearson 相关系数达到 0.407,并可迁移至 202 个具有实测 Ki、Kd、IC50 或 EC50 的独立晶体结构,相关系数达到 r = 0.467。 我们将该模型与三个对照进行了比较:靶标均值预测器、仅使用配体描述符的基线模型,以及靶标内相关性;同时,我们记录了该模型表现良好与表现不佳的情形,包括其不适用于构象重评分这一点。在针对单一 GABAA 受体靶标的一个独立 30 个化合物系列上,PandaDock 的经验评分函数在所评估的 25 种方法中排名第 8,优于所有测试的 AutoDock Vina 和 Vinardo 配置;而 GNN 的评分低于 Vina,这与在 SAIR 上识别出的靶标内性能上限一致。 在 PDBbind v2020 refined 数据集的完整规模测试中(n = 4,640,天然晶体姿势),完全独立训练的 SAIR 模型达到 r = 0.531;而一个仅在 PDBbind 上、采用靶标互斥划分训练的专用模型,在其自身保留测试复合物上达到 r = 0.690,这是本工作中关于 PandaDock 亲和力预测具有泛化能力的最有力证据。 PandaDock 以开源许可证发布于 https://github.com/pritampanda15/PandaDock,提供完整的命令行接口和可复现的基准测试框架。

我们提出了 PandaDock,这是一个开源分子对接平台,集成了具有解析梯度的柔性配体构象搜索、预计算亲和力网格引擎、用于诱导契合、金属配位和系链对接的专用模块,以及一个经过大规模训练的 SE(3) 等变图神经网络评分函数。

配体柔性被表示为扭转树,构象参数通过带有 Metropolis 接受准则的蒙特卡罗方法进行优化,并进一步由 L-BFGS 精修;其中旋转梯度通过 SO(3) 指数映射导数的闭式表达获得,而非通过有限差分计算。亲和力网格采用一种分块邻居选择方案构建,该方案是精确的,并且比稠密评估快 5.6–9.7 倍;对于共享同一受体和位点的配体,这些网格可被缓存,从而将一个包含六个配体的系列的计算时间从 29.3 s 降低至 10.4 s。

在涵盖 14 个靶标家族的 814 个蛋白质-配体复合物上,PandaDock 在 rank 1 时有 33.7% 的案例能够恢复出与晶体构象几何偏差在 2 Å 以内的构象,而在其返回的构象集合中,这一比例达到 57.0%。该 GNN 评分函数在来自 SAIR 的 741,706 个共折叠复合物上、在靶标不重叠划分条件下进行训练,在 90,219 个留出复合物上达到 Pearson 相关系数 r = 0.407,并可迁移到 202 个具有实测 Ki、Kd、IC50 或 EC50 的独立晶体结构上,达到 r = 0.467。

我们将该模型与三种对照进行了比较:靶标均值预测器、仅使用配体描述符的基线模型,以及靶标内相关性;并记录了其表现良好与表现不佳的情形,包括其不适用于构象重评分这一点。在针对单一 GABAA 受体靶标的一个独立 30 个化合物系列上,PandaDock 的经验评分函数在所评估的 25 种方法中排名第 8,优于所有测试过的 AutoDock Vina 和 Vinardo 配置;而 GNN 的表现低于 Vina,这与在 SAIR 上识别出的靶标内性能上限一致。

在 PDBbind v2020 refined 集的全规模测试上(n = 4,640,天然晶体构象),完全独立的 SAIR 模型达到 r = 0.531;而一个仅在 PDBbind 上、在靶标不重叠划分条件下训练的专用模型,在其自身留出测试复合物上达到 r = 0.690,这是本工作中关于 PandaDock 亲和力预测具有泛化能力的最有力证据。PandaDock 在开源许可证下发布,地址为 https://github.com/pritampanda15/PandaDock,并提供完整的命令行界面和可复现实验基准测试框架。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.19.745667v1?rss=1

🏷️ 分子对接 柔性配体搜索 SE(3)等变图神经网络 蛋白质-配体亲和力预测 计算机辅助药物设计