- 3 次围观
蛋白质语言模型(PLM)可将蛋白质序列编码为用于下游任务的嵌入表示。PLM基于利用进化约束的掩码学习目标进行训练。尽管针对ESM-2的可解释性研究主要聚焦于折叠蛋白质,但其在内在无序蛋白质(IDP)上的表现仍缺乏研究;IDP占人类蛋白质组的相当大比例,并与多种疾病相关。由于IDP的氨基酸序列所经历的进化约束类型不同于折叠蛋白质,我们推测,PLM在无序区域与折叠区域上的表现也会有所不同。本文表明,ESM-2在无序区域的注意力有所降低,但仍能编码具有生物学意义的信号。即使在高度无序的情况下,该模型仍会对与疾病相关的残基赋予更高的注意力。此外,我们还表明,IDP的关键特征——回转半径和个体动态接触图——均可从模型的logits和嵌入表示中获得。这些发现表明,尽管PLM倾向于结构化残基,但其仍能捕获与IDP生物学相关的有价值信息。
蛋白质语言模型(PLM)能够将蛋白质序列编码为用于下游任务的嵌入表示。PLM基于利用进化约束的掩码学习目标进行训练。尽管针对ESM-2的可解释性研究主要聚焦于折叠蛋白质,但其在内在无序蛋白质(IDP)上的表现仍缺乏研究;IDP占人类蛋白质组的很大一部分,并与多种疾病密切相关。由于IDP的氨基酸序列受到不同类型的进化约束,我们推测,PLM在无序区域和折叠区域上的表现会有所不同。本文表明,ESM-2在无序区域上的注意力有所降低,但仍能编码具有生物学意义的信号。即使在高度无序的情况下,该模型仍会对与疾病相关的残基分配更高的注意力。此外,我们还表明,IDP的回转半径和个体动态接触图这两项关键特征,均可从模型的logits和嵌入表示中获得。这些发现表明,尽管PLM偏向于结构化残基,但其仍能捕捉与IDP生物学相关的有价值信息。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.10.750691v1?rss=1
🏷️ 蛋白质语言模型 机制可解释性 内在无序蛋白质 蛋白质结构预测 注意力机制 蛋白质嵌入表示
来源出处
蛋白质语言模型的机制可解释性揭示了其编码的内在无序蛋白质结构与功能特性
https://www.biorxiv.org/content/10.64898/2026.09.10.750691v1?rss=1