- 1次围观
药物靶点亲和力模型输出的是其训练所对应的终点,而药物化学决策所依据的往往是不同的测定读数。在本研究中,我们训练了一个 DeepPurpose 模型,从分子图和蛋白质序列估计抑制常数(Ki),并考察这些预测值能否在不将 Ki 与 IC50 视为可互换指标的前提下,通过实证方式与实测 IC50 值建立对应关系。在未使用 Davis 训练数据的情况下,基于 BindingDB 训练的模型检查点在 Davis 激酶基准测试中仍保持了有用的跨靶点排序能力(一致性指数为 0.860)。随后,我们根据 ChEMBL 37 中编码为结合测定(Binding assays;assay_type = 'B')的记录重建了 Ki 训练集,并剔除了删失记录以及重复测定重现性较差的靶点。在尚未进行任何 IC50 校准之前,这一处理将经泄漏清理的激酶面板上的中位倍数误差从 16.35 倍降低至 9.23 倍,并将包含 14 个靶点的非激酶面板上的中位倍数误差从 15.30 倍降低至 7.90 倍。进一步采用相似性引导的留一法校准后,在 Tanimoto 相似度 T = 0.6 时,原始模型检查点和 ChEMBL 模型检查点在非激酶面板上的中位误差分别降至 3.12 倍和 3.22 倍。由于重新训练消除了相当一部分表观校正效应,我们将该校准解释为模型输出与 IC50 测定空间之间依赖于靶点和化学结构的经验偏移,而非 Ki 到 IC50 的机制性转换。在另一项针对公开记录的项目级分层分析中,被归类为生化 Ki 的子集其中位重复测定变异为 2.41 倍,而生化 IC50 子集为 3.30 倍;经小样本校正后,Ki 变异更接近 2.8 倍。这些数值为剩余校准误差提供了经验尺度,而非理论上的性能上限。相似性而非校准样本数量决定了准确性与覆盖范围之间的主要权衡。所得数值可作为用于跨靶点初筛的替代性 IC50 估计值;而在单一靶点内部进行排序,仍是当前架构的局限。
药物靶点亲和力模型输出的是其训练所对应的终点,而药物化学决策通常依据不同的检测读数作出。在本研究中,我们训练了一个 DeepPurpose 模型,基于分子图和蛋白质序列估计抑制常数(Ki),并考察这些预测值能否在不将 Ki 与 IC50 视为可互换指标的前提下,通过经验方法与实测 IC50 值建立对应关系。在未使用 Davis 数据进行训练的情况下,一个在 BindingDB 上训练的模型检查点在 Davis 激酶基准测试中仍保持了有用的跨靶点排序能力(协调指数为 0.860)。随后,我们依据 ChEMBL 37 中编码为结合实验(assay_type = 'B')的记录重新构建了 Ki 训练集,并剔除了删失记录以及重复实验重现性较差的靶点。在尚未进行任何 IC50 校准之前,这一处理将经数据泄漏清理的激酶面板上的中位倍数误差从 16.35 倍降低至 9.23 倍,并将一个包含 14 个非激酶靶点的面板上的中位误差从 15.30 倍降低至 7.90 倍。进一步采用相似性引导的留一法校准后,在 Tanimoto 相似性阈值 T = 0.6 时,原始模型检查点和 ChEMBL 模型检查点在非激酶面板上的中位误差分别降至 3.12 倍和 3.22 倍。由于重新训练消除了表观校正效应中的相当一部分,我们将该校准解释为模型输出空间与 IC50 检测空间之间依赖于靶点和化学结构的经验偏移,而非 Ki 到 IC50 的机制性换算。在另一项针对公共记录的项目层面分层分析中,被归类为生化 Ki 的记录子集的重复实验变异性中位值为 2.41 倍,而生化 IC50 记录的相应值为 3.30 倍;经小样本校正后,Ki 变异性更接近 2.8 倍。这些数值为剩余校准误差提供了经验尺度,而非理论上的性能上限。相似性,而非校准样本的数量,决定了准确性与覆盖范围之间的主要权衡。所得数值可作为跨靶点初筛的替代性 IC50 估计值;在单一靶点内进行排序仍是当前模型架构的局限。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.04.749433v1?rss=1
🏷️ 药物-靶点亲和力预测 Ki与IC50校准 深度学习 分子相似性 虚拟筛选