- 11 次围观
由于不同患者和队列之间的维度、语义和分布存在差异,整合异质性临床与分子数据以进行癌症预后预测仍然具有挑战性。在此,我们提出 DeMoP,这是一种由语言模型引导的专家混合框架,可将结构化患者画像序列化为自然语言序列,并从临床变量、拷贝数改变和基因描述中学习自适应的预后表征。DeMoP 结合了经微调的 DeBERTa-v3-large 编码器、基于注意力的词元池化以及残差专家混合预测头。在来自两个独立泛癌队列的留出测试中,即 GENIE(63,090 名患者)和 TCGA(4,123 名患者),DeMoP 的表现优于所评估的传统机器学习和深度学习基线模型,在两个队列中分别取得了 0.939 和 0.805 的 AUROC,以及均为 0.72 的 1 类 F1 分数。一个在 GENIE 上训练的模型可直接迁移至 TCGA,并取得总体 1 类 F1 分数 0.62。基因层面的消融实验重新识别出已知的癌症相关基因,并突出了研究较少的候选基因。DeMoP 为异质性生物医学数据整合、跨队列结局预测和模型解释提供了一种统一方法。
由于不同患者及队列之间的维度、语义和分布存在差异,整合异质性临床与分子数据以进行癌症预后预测仍然具有挑战性。在此,我们提出 DeMoP,这是一种由语言模型引导的专家混合框架,可将结构化患者特征序列化为自然语言序列,并从临床变量、拷贝数改变和基因描述中学习自适应的预后表征。DeMoP 结合了经过微调的 DeBERTa-v3-large 编码器、基于注意力的词元池化机制以及残差式专家混合预测头。
在来自两个独立泛癌队列的留出测试中,即 GENIE(63,090 名患者)和 TCGA(4,123 名患者),DeMoP 优于所评估的传统机器学习和深度学习基线模型,分别取得了 0.939 和 0.805 的 AUROC,以及在两个队列中均达到 0.72 的 1 类 F1 分数。一个在 GENIE 上训练的模型可直接迁移至 TCGA,并获得总体 1 类 F1 分数 0.62。基因层面的消融分析不仅识别出已知的癌症相关基因,还突出了研究较少的候选基因。DeMoP 为异质性生物医学数据整合、跨队列结局预测和模型解释提供了一种统一的方法。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.24.746579v1?rss=1
🏷️ 癌症预后 多模态数据整合 语言模型 混合专家 跨队列迁移
来源出处
DeMoP:一种由语言模型引导的用于癌症预后的混合专家框架
https://www.biorxiv.org/content/10.64898/2026.08.24.746579v1?rss=1