语言模型生成的生物学依据能够实现抗信息泄漏的靶点—适应症成功预测

由 root 提交于 周三, 09/30/2026 - 20:47
识别哪些靶点–适应症(T-I)假设能够转化为临床成功,仍是药物发现领域面临的核心挑战。我们提出 PRIORITI(Prospective Rationale-Informed Outcome Reasoning for Integrated Target-indication Intelligence,面向整合靶点–适应症智能的前瞻性、基于 rationale 的结果推理),这是一种具有抗信息泄漏能力的框架,用于将上游生物学证据综合与结果预测相分离。给定一个靶基因和疾病适应症,经过领域指导的大型语言模型(LLM)基于预先指定的证据通道,综合与药物无关的人类遗传学证据。随后,将这些证据进行嵌入,并与从基因摘要和疾病定义中获得的静态实体上下文相结合。所得表征用于拟合监督模型,该模型基于6784个经过时间校准的历史T-I结果进行训练,构成了目前针对该任务建立的规模最大的队列之一。在包含1696个T-I配对的历史留出测试集上,PRIORITI取得了0.883的ROC-AUC和0.023的期望校准误差(ECE),其性能优于静态靶点与适应症上下文基线模型以及人工整理的遗传学证据参考模型。在严格位于截断日期之后的时间外基准测试中,该测试包含765个T-I配对,是迄今报道的规模最大的同类评估队列,PRIORITI仍保持稳健性能,ROC-AUC为0.817,PR-AUC为0.357,ECE为0.044,超过了静态靶点与适应症上下文基线模型以及直接的零样本LLM预测。进一步地,一个标签盲化的基于LLM的解释器将锁定后的预测结果转化为可审计的优先级排序依据。总体而言,PRIORITI在下游转化投资之前,为T-I优先级排序提供了经校准的、以生物学为首要依据的概率预测,以及面向决策的论证依据。

识别哪些靶点–适应证(target-indication,T-I)假设能够转化为临床成功,仍是药物研发领域面临的核心挑战。我们提出了 PRIORITI(Prospective Rationale-Informed Outcome Reasoning for Integrated Target-indication Intelligence,面向整合靶点–适应证智能的前瞻性、基于依据的结局推理)框架。该框架具有抗信息泄漏能力,将上游生物学证据综合与结局预测相分离。在仅给定靶基因和疾病适应证的情况下,由领域指令驱动的大语言模型(LLM)通过预先规定的证据通道,综合与具体药物无关的人类遗传学证据。随后,将这些证据进行嵌入,并与从基因摘要和疾病定义中提取的静态实体背景信息相结合。所得表征用于拟合监督模型;该模型基于6,784个经过时间校准的历史T-I结局进行训练,这是目前针对该任务构建的最大规模队列之一。在由1,696对T-I构成的留出历史测试集上,PRIORITI取得了0.883的ROC-AUC和0.023的预期校准误差(ECE),优于静态靶点与适应证背景基线模型以及人工整理的遗传学证据参照模型。在严格限定于截止日期之后的时间外基准测试中,包含765对T-I,是迄今报告的此类评估中规模最大的队列,模型性能仍保持稳健,ROC-AUC为0.817,PR-AUC为0.357,ECE为0.044,优于静态靶点与适应证背景基线模型以及直接进行零样本LLM预测的模型。进一步地,一个对标签盲化的基于LLM的解释器将锁定的预测结果转化为可审计的优先级排序依据。总体而言,在开展后续转化投资之前,PRIORITI为T-I优先级排序提供了经校准的、以生物学为先导的概率评估,以及面向决策的推理依据。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.24.754137v1?rss=1

🏷️ 靶点-适应症预测 大型语言模型 抗信息泄漏 人类遗传学证据 药物发现 机器学习