- 3 次围观
序列到活性模型以DNA序列作为输入,并预测转录因子结合和基因表达等基因组活性。近年来,将可解释人工智能(xAI)方法(如DeepLIFT)应用于这类模型,已在诸多基因组学问题上取得突破,包括解析转录因子结合语法以及预测遗传变异的效应。然而,序列到活性解释结果的可靠性仍然存在显著不确定性。因此,我们需要准确的概率性置信度度量,以区分可靠与不可靠的解释。为此,研究人员近期致力于表征S2A模型集成之间的变异性。然而,以往工作主要侧重于利用模型集成来提升模型预测本身的性能。在这里,我们旨在评估模型集成是否也可用于改进事后xAI方法得到的特征归因。我们发现,对多个模型的归因结果进行集成能够改善下游应用表现,包括识别转录因子基序和预测调控性遗传变异。我们表明,采用蒙特卡洛Dropout(MCDropout)构建集成,在训练阶段计算成本大幅降低的情况下,其性能接近于训练多个模型所形成的集成,但仍未达到后者的水平。
序列到活性模型以 DNA 序列作为输入,并预测转录因子结合和基因表达等基因组活性。近年来,将可解释人工智能(xAI)方法(如 DeepLIFT)应用于这些模型,已在许多基因组学问题上取得突破,包括解析转录因子结合语法以及预测遗传变异的效应。然而,关于序列到活性解释结果的可靠性,仍然存在显著的不确定性。因此,我们需要准确的置信度概率度量,以区分可靠与不可靠的解释。为此,研究人员最近致力于表征 S2A 模型集成之间的变异性。然而,以往工作主要关注利用模型集成来提升模型预测本身的性能。本文旨在评估,模型集成是否也可用于改进后验 xAI 方法得到的特征归因。我们发现,对多个模型的归因结果进行集成能够改善下游应用表现,包括识别转录因子基序和预测调控性遗传变异。我们表明,使用蒙特卡洛 Dropout(MCDropout)构建集成,在训练阶段计算成本大幅降低的情况下,其性能接近于但仍未达到训练多个模型所形成集成的水平。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.08.737315v1?rss=1
🏷️ 集成学习 特征归因 序列到活性模型 可解释人工智能 转录因子结合 蒙特卡洛Dropout
来源出处
集成学习能否改进序列到活性模型的特征归因?
https://www.biorxiv.org/content/10.64898/2026.07.08.737315v1?rss=1