面向心血管疾病(CVDs)跨数据集泛化生物标志物发现的可解释人工智能

root 提交于 周三, 07/29/2026 - 10:47
心血管疾病(CVDs)是异质性强、受多因素影响的疾病,从婴儿期到老年期始终是全球死亡的首要原因。为加速疾病预防并改善发病结局,必须尽早识别并干预相关风险因素。转录组学技术的进步产生了大量异质性的基因表达数据。然而,基因表达数据在技术层面的异质性降低了同时比较多个跨平台数据集的能力。为弥合这一差距,我们系统评估了三种数据协调技术:Shambhala-2、TDM 和 UPC,以在保留生物学信号的同时,将异质数据对齐到共享的表达空间中。 我们的流程整合了25个独立数据集,共计983个样本,涵盖来自 RNA-seq 和微阵列平台的23种不同 CVD 表型。该框架在三种数据模态(即 RNA-seq、微阵列杂交以及 RNA-seq + 微阵列)和多种组织类型上,对35种机器学习(ML)和深度学习(DL)分类器进行了基准评测,其中包括 Transformer 和 ResNet。为确保临床可信性,我们采用了多种可解释人工智能(XAI)方法,如 SHapley additive exPlanations(SHAP)和积分梯度(Integrated Gradients, IGs),并使用扰动曲线以上面积(Area over the Perturbation Curve, AOPC)、敏感性(Sensitivity)和不忠实度(Infidelity)等定量指标评估其可靠性。 结果表明,Shambhala-2 通过最大化生物学信号与平台效应之比,提供了更优的协调效果。对 XAI 方法的评估显示,基于 Shapley 的方法在高维数据中识别关键基因组特征方面具有最高稳定性。功能富集和通路分析进一步证实,所鉴定的生物标志物参与了多种关键心血管过程,包括炎症、免疫调控、氧化应激和血管重塑。 总体而言,本研究提供了一条可扩展且可解释的路线图,将 XAI 与跨数据集生物标志物发现相结合,为向精准心脏病学转型提供支持。

心血管疾病(CVDs)是异质性且多因素驱动的疾病,从婴儿期到老年期始终是全球死亡的首要原因。为加速疾病预防并改善发病情况,需要及早识别并治疗相关风险因素。转录组学技术的进步产生了大量异质性的基因表达数据。基因表达数据在技术层面的异质性降低了同时比较多个跨平台数据集的能力。为弥合这一差距,我们系统评估了三种数据协调技术:Shambhala-2、TDM 和 UPC,以在保留生物学信号的同时,将异质性数据对齐到共享的表达空间中。

我们的流程整合了 25 个独立数据集,共包含 983 个样本,涵盖 23 种不同的心血管疾病表型,数据来源包括 RNA-seq 和微阵列平台。该框架在三种数据模态(即 RNA-seq、微阵列杂交以及 RNA-seq + 微阵列)和多种组织类型上,对 35 种机器学习(ML)和深度学习(DL)分类器进行了基准评估,其中包括 Transformer 和 ResNet。为确保临床可信性,我们应用了多种可解释人工智能(XAI)方法,如 SHapley additive exPlanations(SHAP)和 Integrated gradients(IGs),并使用扰动曲线上方面积(AOPC)、敏感性(Sensitivity)和不忠实度(Infidelity)等定量指标评估其可靠性。

结果表明,Shambhala-2 通过最大化生物学信号与平台效应之比,提供了更优的协调效果。对 XAI 方法的评估显示,基于 Shapley 的方法在高维数据中识别关键基因组特征方面具有最高的稳定性。功能富集和通路分析进一步证实,所鉴定的生物标志物参与了关键的心血管过程,包括炎症、免疫调控、氧化应激和血管重塑。总体而言,本研究提供了一种可扩展且可解释的路线图,将 XAI 与跨数据集生物标志物发现相结合,为向精准心脏病学转型提供支持。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.23.740273v1?rss=1

🏷️ 心血管疾病 生物标志物发现 转录组学 跨数据集泛化 可解释人工智能 基因表达整合