- 2 次围观
通用型语言模型正日益被应用于蛋白质设计流程中,然而其评估变体效应的能力仍不明确。为回答这一问题,我们提出了 PG-LLM——一个基于 ProteinGym 构建的基准,用于在 217 个蛋白质变体优先排序任务上评估通用型语言模型。每项任务均遵循相同格式:语言模型接收一条野生型蛋白质序列、一段测定描述,并在无法访问多序列比对或蛋白质结构信息的情况下,对 50 条突变体序列按适应度进行排序。我们评估了 13 个语言模型,并在相同候选集合上使用相同评估指标,对 95 个已发表的蛋白质预测器进行了重新评分。Claude Opus 5 以 Spearman 相关系数 {rho} = 0.406 位居主要排行榜首位,略微领先于得分为 0.402 的 GPT-5.6 Sol。然而,当仅在两个模型均完成评分的测定上进行比较时,GPT-5.6 Sol 的得分高于 Opus 5。Opus 5 优于 95 个已发表蛋白质预测器中的 49 个,其中包括 46 个仅基于序列的方法中的 41 个,并且接近 ESM2-650M 的 {rho} = 0.411,但仍低于领先预测器 VenusREM 的 {rho} = 0.523。随着测试时计算量的增加,GPT、Claude 和 Gemini 模型的变体排序性能均有所提升,但这种增益在缩小与专用蛋白质预测器差距之前便开始趋于平缓。不同于仅基于序列的预测器在进化比对更深的蛋白质上表现更好,LLM 的准确性在不同比对深度下变化很小。PG-LLM 表明,无需借助外部工具的语言模型能够捕捉到大量蛋白质变体信号,并且已经优于许多成熟的基于序列的预测器。这些结果确立了语言模型作为生物分子推理器的新兴能力,同时也界定了其在变体优先排序流程中实现可靠应用仍然存在的提升空间。
通用大语言模型正日益被应用于蛋白质设计流程中,然而,它们评估变体效应的能力仍不明确。为回答这一问题,我们提出了 PG-LLM——一个基于 ProteinGym 构建的基准,用于评估通用大语言模型在 217 个蛋白质变体优先级排序任务中的表现。每个任务均遵循相同的格式:语言模型接收一条野生型蛋白质序列、一个测定描述,并在无法访问多序列比对或蛋白质结构信息的条件下,对 50 条突变体序列按适应度进行排序。我们评估了 13 个语言模型,并使用相同的候选集和相同的评估指标,对 95 个已发表的蛋白质预测器进行了重新评分。Claude Opus 5 以 {rho} = 0.406 的 Spearman 相关系数位居主榜单首位,略高于 GPT-5.6 Sol 的 0.402。然而,当仅在两个模型均有评分的测定上进行比较时,GPT-5.6 Sol 的得分高于 Opus 5。Opus 5 优于 95 个已发表蛋白质预测器中的 49 个,其中包括 46 个仅基于序列的方法中的 41 个,并且其表现接近 ESM2-650M({rho} = 0.411),但仍低于领先预测器 VenusREM({rho} = 0.523)。在 GPT、Claude 和 Gemini 模型中,变体排序性能会随着测试时计算量的增加而提升,但这种增益在缩小与专用蛋白质预测器差距之前便趋于减弱。不同于仅基于序列的预测器——其在具有更深进化比对的蛋白质上表现更好——大语言模型的准确性随比对深度变化很小。PG-LLM 表明,无需工具辅助的语言模型能够捕捉到大量蛋白质变体信号,并且已经超越许多既有的基于序列的预测器。这些结果确立了语言模型作为生物分子推理器的新兴能力,同时也界定了其在变体优先级排序流程中实现可靠应用所剩余的提升空间。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.27.741045v1?rss=1
🏷️ 蛋白质变体效应 大语言模型 基准评测 蛋白质排序 ProteinGym