多任务生物活性预测中的不确定性基准评测与风险排序改进

root 提交于 周三, 09/23/2026 - 10:47
多任务生物活性预测可在不同测定任务之间迁移信息,但实验优先级排序还需要不确定性估计,以识别不可靠的预测结果。我们在随机划分和聚类划分条件下,基于100个 ChEMBL27 测试测定任务和100个 ChEMBL37 测定任务,对五种多任务预测器的预测准确性与不确定性校准进行了基准评测。不确定性校准采用原生不确定性、深度集成(Deep Ensemble)和蒙特卡洛 Dropout(MC Dropout)方法;此外,针对两种高斯过程(GP)骨干模型比较了风险排序效果。自适应深度核拟合(ADKF)取得了最佳的平均校准结果,而在采用原生不确定性时,深度核迁移(DKT)在误差排序方面优于 ADKF。 我们还提出了影响校准支持重构(Influence Calibrated Support Reconstruction,ICSR)方法,这是一种面向基于核的预测器的风险评分。ICSR 将实测的支持集重构误差与查询特异性影响相结合,并将二者的加权平均值稳定地收缩至完整支持集均值,从而在保留预测生物活性的同时,对高斯过程不确定性进行校正。结合 DKT 和 ADKF 时,在每个评测面板和每种数据划分下,ICSR 在三项平均风险排序指标上的表现均优于原生不确定性和经调整的邻域比较方法。ICSR 实现了14.2%–19.6%的平均半查询 MAE 降幅(R50);其中,R50 表示保留风险最低的一半查询后,平均绝对误差(MAE)的下降百分比。一个回顾性选取的 SARS-CoV-2 主蛋白酶案例进一步展示了该方法在筛选更可靠预测结果方面的应用价值。该基准评测支持对校准性能与误差排序进行联合评估,而 ICSR 则提升了基于核的生物活性预测结果的选择性使用能力。

多任务生物活性预测能够在不同测定任务之间迁移信息,但实验优先级排序还需要不确定性估计,以识别不可靠的预测结果。我们在随机划分和聚类划分条件下,针对100个 ChEMBL27 测试测定任务和100个 ChEMBL37 测定任务,对五种多任务预测器的预测准确性与不确定性校准进行了基准评估。校准采用原生不确定性、深度集成(Deep Ensemble)和 MC Dropout 不确定性;同时,针对两种高斯过程(GP)骨干模型比较了风险排序效果。自适应深度核拟合(ADKF)取得了最佳的平均校准结果,而在采用原生不确定性时,深度核迁移(DKT)在误差排序方面优于 ADKF。

我们还提出了影响校准支持重构(Influence Calibrated Support Reconstruction,ICSR),这是一种面向基于核的预测器的风险评分方法。ICSR 将实测的支持集重构误差与查询特异性影响相结合,并将二者的加权平均值向完整支持集均值进行稳定化,从而在保持预测生物活性不变的同时调整高斯过程不确定性。结合 DKT 和 ADKF 时,与原生不确定性及一种经过改编的邻域比较方法相比,ICSR 在每个评估面板和每种数据划分下均提升了三项平均风险排序指标。ICSR 实现了14.2%–19.6%的平均半查询 MAE 降幅(R50);其中,R50 表示保留风险最低的一半查询样本后,平均绝对误差(MAE)的下降百分比。一个回顾性选取的 SARS-CoV-2 主蛋白酶案例进一步展示了其在筛选更可靠预测结果方面的应用。该基准研究支持对校准效果与误差排序进行联合评估,而 ICSR 则提升了基于核的生物活性预测的选择性应用能力。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.15.751772v1?rss=1

🏷️ 多任务生物活性预测 不确定性校准 风险排序 高斯过程 深度集成 药物筛选