核方法实现了针对复杂性状的可解释基因优先排序

root 提交于 周六, 07/11/2026 - 14:47
全基因组关联研究(GWAS)已鉴定出大量变异—性状关联;然而,将效应基因指派至GWAS位点仍然具有挑战性。基于相似性的机器学习方法,如PoPS,通过性状相关基因之间共享的功能特征来优先排序效应基因。这些模型为每个基因分配一个优先级评分,并在每个GWAS位点内提名一个单一效应基因。然而,这些评分对于解释某个基因为何被优先排序,或该提名是否具有生物学合理性,所提供的信息十分有限。为弥补这一空白,我们提出了核化多基因优先级评分(Kernelized Polygenic Priority Score, K-PoPS),这是PoPS的一种核化重构形式,能够通过将每个预测分解为训练基因的贡献来实现以基因为中心的解释。对于每个被优先排序的基因,K-PoPS报告排名靠前的贡献基因以及锚定评分(anchor score),后者用于量化来自用户定义的性状相关基因集合的支持程度。在38个Pan-UK Biobank性状中,作为K-PoPS基础的全特征普通最小二乘(OLS)实现,相较于默认PoPS,在37个可评估性状中的26个上提高了最近基因富集度。在具有人工整理锚定集的25个性状中,获得锚定评分支持的预测相比未获得支持的预测,对最近基因代理的富集更高。在应用于载脂蛋白B血液水平时,K-PoPS提名SCARB1而非UBC基因,并进一步提供了有力的解释以支持这一预测。借助解释性证据,K-PoPS在一个扩张型心肌病位点中识别出多个可信的效应基因,这与简约性假设相悖。总之,K-PoPS提供了一个事后分析框架,用于审视和解释GWAS效应基因提名。

在持有人为作者/资助方,其已授予 bioRxiv 永久展示该预印本的许可。 本文依据 CC-BY 4.0 国际许可协议 公开提供。

返回顶部 上一篇 下一篇

发表于 2026 年 7 月 10 日。 下载 PDF 补充材料 电子邮件

感谢您有兴趣帮助传播 bioRxiv。 您的电子邮件 * 您的姓名 * 发送至 * 请输入多个地址,每行一个,或用逗号分隔。

您将要通过电子邮件发送以下内容 用于复杂性状的可解释基因优先排序的核化方法

消息主题 (您的姓名)从 bioRxiv 转发了一个页面给您

消息正文 (您的姓名)认为您可能希望查看 bioRxiv 网站上的此页面。

您的个人消息

验证码 此问题用于测试您是否为人类访客,并防止自动垃圾信息提交。

分享

用于复杂性状的可解释基因优先排序的核化方法

Taotao Tan , Md. Abul Hasan Samee

bioRxiv 2026.07.08.737338; doi: https://doi.org/10.64898/2026.07.08.737338

分享本文: 复制

引文工具

用于复杂性状的可解释基因优先排序的核化方法

Taotao Tan , Md. Abul Hasan Samee

bioRxiv 2026.07.08.737338; doi: https://doi.org/10.64898/2026.07.08.737338


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.08.737338v1?rss=1

🏷️ GWAS 基因优先排序 核方法 模型可解释性 复杂性状