- 2 次围观
基于单核苷酸多态性(SNP)数据预测常见性状具有较大挑战性,这主要是由于性状的多基因性、较小的效应量,以及潜在的中介性或虚假跨性状关联所致。我们提出了一种将基因组注释与已知跨性状关系相结合的建模方法,该方法借助因果可靠概念瓶颈模型(Causally Reliable Concept Bottleneck Models,C2BM)实现。C2BM 是一种深度学习架构,能够在由可解释概念构成的图上对联合性状分布进行因子分解。该设计使性状预测不仅能够利用基因组输入,还能够利用其他已观测性状的信息。此外,该模型的可解释架构使我们能够探究特定的性状—性状关系如何影响 SNP 层面的预测结果。我们在一个涵盖五种性状的多性状全基因组关联研究(GWAS)数据集上评估了该方法,结果表明,当能够获得相关性状的真实标签时,C2BM 可以提升预测性能。此外,通过分析性状—性状关系影响预测结果的方式差异,我们推测,这些差异可能反映了共享遗传机制或间接效应的存在与否。本文已被 CIBB 2026 会议(https://cibb2026.teralab.ai/)接收。
基于单核苷酸多态性(SNP)数据预测复杂性状颇具挑战性,这主要源于性状的多基因性、微小的效应值,以及可能存在的介导性或虚假的跨性状关联。我们提出了一种建模方法,通过利用因果可靠概念瓶颈模型(Causally Reliable Concept Bottleneck Models,C2BM),将基因组注释与已知的跨性状关系相结合。C2BM 是一种深度学习架构,能够在由可解释概念构成的图上对联合性状分布进行因子分解。该设计使性状预测不仅能够利用基因组输入,还可以借助其他已观测性状的信息。此外,该模型的可解释架构使我们能够探究特定的性状—性状关系如何影响 SNP 层面的预测结果。我们在一个涵盖五种性状的多性状全基因组关联研究(GWAS)数据集上对该方法进行了评估,结果表明,当能够获得相关性状的真实标签时,C2BM 可以提升预测性能。此外,通过分析性状—性状关系影响预测结果的方式所存在的差异,我们推测,这些差异可能反映了共享遗传机制或间接效应的存在与否。本文已被 CIBB 2026 会议(https://cibb2026.teralab.ai/)接收。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.04.749112v1?rss=1
🏷️ 单核苷酸多态性 全基因组关联研究 因果概念瓶颈模型 多性状预测 深度学习
来源出处
整合基因组注释与性状依赖关系,利用因果概念瓶颈模型对单核苷酸多态性进行优先级排序
https://www.biorxiv.org/content/10.64898/2026.09.04.749112v1?rss=1