- 4 次围观
隐蔽结合位点预测方法的比较几乎完全依赖于 top-n 恢复率这一指标,但该指标混合了两种彼此独立的能力:在正确位置提出候选位点,以及将其排序得足够靠前以便被观察到。我们通过保留每个候选提议与真实位点的逐候选重叠信息,而非仅保留前五名结果,在 CryptoBench 基准上对四种结构差异显著、时间跨度覆盖 2009 至 2026 年的检测器进行了分析,从而将这两种能力区分开来。 这种区分带来了显著差异,并重新排列了该领域的方法格局。在指定测试折中的 178 个结构上,fpocket——一种 2009 年提出的纯几何方法——为 74.2% 的靶标提出了符合条件的候选位点,是所有被测试工具中覆盖率最高的;然而,其前五名结果中仅有 43.8% 能够呈现出这样的候选位点。P2Rank 提出了符合条件候选位点的比例为 66.3%,其中有 63.5% 能在前五名中呈现;而 IF-SitePred——一种基于蛋白质语言模型嵌入的 2024 年方法——对应数值分别为 70.8% 和 61.8%。不同工具之间的覆盖率仅相差 8 个百分点,而转化率——即某工具自身覆盖中进入前五名的比例——则在 59% 到 96% 之间变化。将这四种检测器取并集后,覆盖率可达到 92.1%,仅有 7.9% 的隐蔽位点对所有检测器都不可见。因此,该领域的提升空间主要在于排序和组合,而非检测本身:若对单一工具已有提议实现完美排序,恢复率可达 74.2%;若对并集实现完美排序,则可达 92.1%;而当前实际达到的仅为 66.3%。 我们表明,其实际后果取决于候选预算。当一个结构携带的候选数少于约 15 个时,新增覆盖率可按约 85% 的比例转化为恢复率;而当候选数高于该阈值时,这一转化比例降至约 51%。这解释了一系列虽然提高了覆盖率却未带来任何回报的干预措施。在这一预算约束下,当几何方法未发现凹陷位置时,利用蛋白质语言模型在这些位置提出口袋,可使测试折数据上的单结构恢复率提高 8.5%(95% 置信区间为 +4.0 至 +13.6),并使由 5 个构象组成的集成以三分之一的墙钟时间达到 20 个构象集成的效果。我们公开了所有工具的逐候选重叠数据,从而无需重新运行任何方法,即可分别报告覆盖率和转化率。
用于预测隐匿结合位点的方法,几乎总是仅以 top-n 召回率进行比较,而这一指标混淆了两种彼此独立的能力:在正确位置提出候选位点,以及将其排到足够靠前从而能够被看到。我们通过保留每个提议对应每个候选位点的重叠情况,而非仅保留前五名结果,在 CryptoBench 基准上对四种结构上彼此不同、时间跨度覆盖 2009 至 2026 年的检测器进行了区分。这样的区分幅度很大,并重排了该领域的方法格局。
在指定测试折的 178 个结构上,fpocket——一种来自 2009 年、纯几何的方法——为 74.2% 的目标提出了符合标准的候选位点,这是所有受测工具中最高的覆盖率;然而,其前五名结果中仅有 43.8% 能呈现出这样的候选位点。P2Rank 的符合标准候选位点提出率为 66.3%,呈现率为 63.5%;而 IF-SitePred——一种构建于蛋白质语言模型嵌入之上的 2024 年方法——提出率为 70.8%,呈现率为 61.8%。各工具之间的覆盖率相差 8 个百分点,而转化率——即某一工具自身覆盖中进入前五名的比例——则在 59% 到 96% 之间变化。将这四种检测器取并集后,覆盖率达到 92.1%,只有 7.9% 的隐匿位点对它们全部都不可见。因此,该领域的提升空间主要在于排序和组合,而非检测本身:若能对单一工具现有提议实现完美排序,覆盖率可达 74.2%;若对并集实现完美排序,则可达 92.1%;而当前实际达到的仅为 66.3%。
我们表明,其实际后果受候选位点预算支配。当一个结构携带的候选位点少于约 15 个时,新增覆盖可按约 85% 的比例转化为召回;高于这一阈值时,转化比例则约为 51%。这解释了一系列提高了覆盖率却没有带来任何回报的干预措施。在这一预算约束下,若在几何方法未发现凹陷的位置利用蛋白质语言模型提出口袋,则可在测试折数据上将单结构召回率提高 8.5%(95% CI:+4.0 至 +13.6),并使五构象集成在仅为二十分之一墙钟时间的条件下达到与二十构象集成相当的效果。我们公开了所有工具的逐候选位点重叠数据,从而无需重新运行任何方法即可分别报告覆盖率与转化率。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.11.743381v1?rss=1
🏷️ 隐蔽结合位点 蛋白质口袋预测 方法比较 排序性能 蛋白质语言模型