- 3 次围观
人类白细胞抗原(HLA)所结合并呈递的肽段范围会调节免疫应答,因此构成了疫苗设计、新抗原发现、自身免疫、移植以及超敏反应研究的基础。现代肽-HLA(pMHC)结合与呈递预测器具有令人瞩目的准确性,但它们本质上是黑箱模型;其内部计算过程不透明,且事后解释方法无法为归因提供保证。本文提出潜在基序相互作用聚合(LAtent Motif INteraction Aggregation,LAMINA)架构,其预测结果在设计上即具备可解释性和可归因性。LAMINA 将HLA伪序列和候选肽段中的每一个无间隔子序列嵌入为学习得到的“软”基序,对每一对HLA-肽段-基序进行评分,最后聚合这些分数以生成预测结果。尽管LAMINA仅包含470万个参数,并且在单台桌面工作站上约十小时即可完成训练,但在保留测试集上的结合亲和力回归任务中,其性能达到或超过当前最先进的预测器,在秩相关性方面也具有竞争力。值得注意的是,尽管该模型完全仅利用序列数据进行训练,但其模型状态与具有结构表征的pMHC复合物中的相互作用能及其他结构指标存在相关性。
人类白细胞抗原(HLA)能够结合并呈递的肽段范围会调节免疫反应,因此构成了疫苗设计、新抗原发现、自身免疫、移植以及超敏反应研究的基础。现代肽段-HLA(pMHC)结合与呈递预测器具有极高的准确性,但它们属于黑箱模型;其内部计算过程不透明,事后解释方法也缺乏归因保证。本文提出潜在基序相互作用聚合(LAtent Motif INteraction Aggregation,LAMINA)架构,其预测结果在构造上具备可解释性和可归因性。LAMINA将HLA伪序列和候选肽段中的每个无间隔子序列嵌入为学习得到的“软”基序,对每一对HLA-肽段-基序进行评分,最后聚合这些评分以生成预测结果。尽管LAMINA仅包含470万个参数,并且在单台桌面工作站上约十小时即可完成训练,但在留出数据的结合亲和力回归任务中,其性能达到或超过当前最先进的预测器,在秩相关性方面也具有竞争力。值得注意的是,尽管该模型完全仅基于序列数据进行训练,其模型状态仍与具有结构表征的pMHC复合物中的相互作用能及其他结构指标相关。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.08.750216v1?rss=1
🏷️ 肽-HLA结合预测 可解释机器学习 潜在基序相互作用 结合亲和力 新抗原发现
来源出处
一种可解释的肽-HLA模型涌现出对结合能学与结构的学习能力
https://www.biorxiv.org/content/10.64898/2026.09.08.750216v1?rss=1