预测的和实验获得的蛋白质-配体坐标及其距离标注与评估数据划分

由 root 提交于 周四, 09/10/2026 - 08:47
结构预测工具如今能够为迄今尚无实验解析结果的蛋白质—配体对提供几何构型。这类数据通常并不附带经过校准、且在实际中可用的系统级指标,因而无法判断给定复合物是否正确,以及应对其赋予多大程度的信任。对于此类问题,彼此独立构建的方法之间的一致性已被确立为一种信号。此前所缺少的是一种能够推导出特定一致性水平究竟意味着什么的方法。我们提出了 PLI-Parallax,该资源将预测几何构型与用于校准这些预测的实验数据一并存储。我们在共享输入上运行了 Chai-1、两种 Boltz-2 配置以及对接引擎 smina,所用数据包括由实验解析结构构成的、包含 19,350 个复合物的晶体层级,以及由 31,746 个交叉对接对构成的语料库层级;后者中的受体缺乏关于预测结果的实验真实值。由此获得了 307,314,646 条残基—配体原子距离记录;借助所存储的坐标,使用者可以在自行选择的截断阈值下重新计算这些记录。对于具备实验数据的情形,我们将不同方法之间的一致性与观测到的准确性进行拟合,并将所得关系推广至缺乏实验数据的情形。通过这种方式,30,567 个系统同时获得了预测的标签准确性和一个分割保形区间。在晶体层级上,该区间以所声明的覆盖率涵盖观测准确性。在语料库层级上,由于两个层级的分布存在差异,该区间用于按照预期标签质量对系统进行排序。该数据集还附带了涵盖七类数据划分方案的 646 个评估配置,其中 631 个报告了在双样本检验下训练实体与测试实体的分离程度。我们对 906 个蛋白质登录号进行了划分,以控制序列泄漏;因此,这里的蛋白质冷启动划分可用于检验跨序列空间的泛化能力。这两个层级既支持基于实验数据的评估,也支持在缺乏实验数据时,以不同配置之间的一致程度为权重的监督。

结构预测工具如今能够为迄今尚无实验解析结果的蛋白质–配体配对提供几何结构数据。这类数据通常未同时提供经过校准且具有实际可用性的逐系统指标,用于判断给定复合物是否正确,以及应在多大程度上信任该结果。对于此类问题,独立构建的方法之间的一致性已被确立为一种有效信号。然而,尚缺乏一种方法来推导给定一致性水平究竟具有多大价值。我们提出了 PLI-Parallax,该资源将预测几何结构与用于校准这些预测所需的实验数据一并存储。

我们在共享输入上运行了 Chai-1、两种 Boltz-2 配置以及对接引擎 smina,所用数据包括一个由 19,350 个实验解析复合物组成的晶体层级,以及一个由 31,746 个交叉对接配对组成的数据集层级;后者所使用的受体均无关于预测结果的实验真值。由此产生了 307,314,646 条残基–配体原子距离记录;借助所存储的坐标,使用者可以按照自行选择的截断值重新计算这些记录。我们利用实验数据允许的部分,将不同方法之间的一致性与观测到的准确性进行拟合,并将这一关系推广至缺乏实验数据的情形。由此,30,567 个系统同时提供了预测的标签准确性及其分割共形区间。在晶体层级上,该区间以所声明的覆盖率覆盖观测到的准确性。在数据集层级上,由于两个层级的分布存在差异,该区间用于按照预期标签质量对系统进行排序。

该资源还附带七类数据划分方案下的 646 个评估配置,其中 631 个报告了在双样本检验下训练实体与测试实体的分离程度。我们对 906 个蛋白质登录号进行了划分,以控制序列泄漏;因此,这里的蛋白质冷启动划分可用于检验模型在序列空间上的泛化能力。这两个层级既支持基于实验数据的评估,也支持在缺乏实验数据时采用由不同配置间一致性程度加权的监督。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.06.749709v1?rss=1

🏷️ 蛋白质-配体复合物 结构预测 分子对接 距离标注 模型校准 冷启动评估