本征无序区中相分离及疾病变异效应的可解释预测

root 提交于 周二, 07/21/2026 - 12:47
蛋白质本征无序区(IDRs)内的编码突变正日益被认为与人类疾病相关,但依赖结构稳定性和基于保守性的指标的传统变异效应预测器仍难以对其进行有效解释。定量评估 IDR 介导的液-液相分离(LLPS)扰动,为解释此类变异的致病影响提供了一种具有生物物理原理基础的方法。然而,现有的 LLPS 预测器存在对自分离蛋白的训练偏倚,对伴侣依赖型相分离的性能有限,并且往往缺乏用于变异优先级排序的可解释性。我们提出一种可解释的集成机器学习框架,将蛋白质语言模型对序列和预测结构的嵌入表示相结合,以预测 LLPS 倾向并将蛋白质分类为自分离型或伴侣依赖型。我们的两步分类器在独立基准数据集上优于现有方法,其中对伴侣依赖型 LLPS 蛋白的提升最为显著。除分类之外,我们的框架还可识别关键的相分离区域并量化突变对 LLPS 的扰动。将其应用于疾病相关变异数据库后,我们发现致病突变在预测的相分离区域中显著富集,并且经常扰动 LLPS 倾向评分,提示突变诱导的 LLPS 失调可能是众多疾病的潜在致病机制。总体而言,我们的框架为识别相分离蛋白并将异常相分离行为与疾病发病机制联系起来提供了一种准确且可解释的方法。

蛋白质本征无序区(intrinsically disordered regions, IDRs)中的编码突变日益被认为与人类疾病相关,但传统依赖结构稳定性和保守性指标的变异效应预测器仍难以对其进行充分解释。量化 IDR 介导的液-液相分离(liquid-liquid phase separation, LLPS)受扰动情况,为解释此类变异的致病影响提供了一种具有物理生物学依据的方法。然而,现有 LLPS 预测器存在对自发相分离蛋白的训练偏倚,对依赖相互作用伙伴的相分离预测性能有限,并且通常缺乏用于变异优先排序的可解释性。我们提出了一种可解释的集成机器学习框架,整合蛋白质语言模型对序列和预测结构的嵌入表示,以预测 LLPS 倾向并将蛋白质分类为自发相分离型或伙伴依赖型。我们的两步分类器在独立基准数据集上优于现有方法,其中对伙伴依赖型 LLPS 蛋白的提升最为显著。除分类外,我们的框架还能识别关键相分离区域,并量化突变对 LLPS 的扰动。在疾病相关变异数据库中的应用表明,致病性突变在预测的相分离区域中富集,并且经常扰乱 LLPS 倾向评分,提示突变诱导的 LLPS 失调可能是多种疾病的一种潜在致病机制。总体而言,我们的框架为识别相分离蛋白并将异常相分离行为与疾病发病机制联系起来提供了一种准确且可解释的方法。

感谢您关注并传播 bioRxiv 的内容。

注:仅为识别您作为本文发送者,才会要求提供您的电子邮件地址。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.14.736885v1?rss=1

🏷️ 本征无序区 液-液相分离 变异效应预测 可解释机器学习 疾病相关突变 蛋白质语言模型