首个 OpenBind 发布版:面向基于结构的人工智能的开放实验结构–亲和力数据集与基准测试

root 提交于 周三, 09/02/2026 - 10:47
将蛋白质–配体结构与结合亲和力数据相联系的高质量实验数据集,对于开发和评估基于结构的机器学习方法至关重要。为满足这一需求,我们发起了开放科学计划 OpenBind,旨在为基于结构的人工智能和分子发现生成大规模实验数据集。在此,我们介绍首个公开发布的 OpenBind 数据集;据我们所知,这是目前规模最大的公开单靶点实验性结构–亲和力数据集。该数据集聚焦于肠道病毒 2A 蛋白酶,包含来自 699 个化合物的 925 个晶体学结合事件,以及与 601 个化合物相关的亲和力测量数据。该数据集整合了初始片段筛选及后续分子研究获得的结构与亲和力数据,将实验确定的蛋白质–配体结合模式与生物物理测量结果联系起来,构成一个连贯的抗病毒发现研究体系。我们利用该数据集,采用包括对接和共折叠在内的代表性基于结构的方法,对蛋白质–配体结构预测、结合亲和力预测和虚拟筛选进行了评估。研究结果揭示了若干对实际基于结构的建模至关重要的挑战:对接性能高度依赖于结合口袋的构象,配体构象难以排序,而基于结构的亲和力预测仍然面临较大挑战。使用片段筛选所得结构对 OpenFold3-p2 进行微调,显著提升了其对相关后续化合物的构象预测和虚拟筛选性能,表明早期阶段获得的实验结构能够支持靶点特异性的模型适配。

将蛋白质-配体结构与结合亲和力数据相联系的高质量实验数据集,对于开发和评估基于结构的机器学习方法至关重要。为满足这一需求,我们发起了开放结合(OpenBind)开放科学倡议,旨在为基于结构的人工智能和分子发现生成大规模实验数据集。在此,我们介绍首个公开发布的 OpenBind 数据集;据我们所知,这是目前规模最大的公开单靶点实验性结构-亲和力数据集。该数据集聚焦于肠道病毒 2A 蛋白酶,包含来自 699 个化合物的 925 个晶体学结合事件,以及 601 个化合物的相关亲和力测量数据。该数据集整合了初始片段筛选和后续分子研究获得的结构及亲和力数据,将实验确定的蛋白质-配体结合模式与生物物理测量结果相联系,构成了一个连贯的抗病毒药物发现研究体系。我们利用该数据集,采用包括对接和共折叠在内的代表性基于结构的方法,对蛋白质-配体结构预测、结合亲和力预测和虚拟筛选进行了评估。结果揭示了若干对实际基于结构的建模至关重要的挑战:对接性能高度依赖于结合口袋的构象,配体结合姿态难以排序,而基于结构的亲和力预测仍然具有较大挑战。利用片段筛选结构对 OpenFold3-p2 进行微调,显著提升了其对相关后续化合物的结合姿态预测和虚拟筛选性能,表明早期实验结构能够支持靶点特异性的模型适配。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.27.747600v1?rss=1

🏷️ OpenBind数据集 蛋白质-配体相互作用 结构-亲和力预测 结构基础人工智能 虚拟筛选 肠道病毒2A蛋白酶