ProtGPT3:一个开源的、可提示控制且经过对齐的蛋白质语言模型家族

由 root 提交于 周二, 06/09/2026 - 18:47
生成式蛋白质语言模型(pLM)能够探索用于蛋白质设计的广阔序列空间,但要将生成过程可靠地控制到期望的功能家族,仍然具有挑战性。尽管蛋白质生成在整体上遵循了自然语言处理(NLP)的发展趋势,但仍有两个方向尚未得到充分探索:一是使模型行为朝向设计目标优化的对齐方法,二是在无需微调的情况下于推理时基于提示进行控制。我们提出了 ProtGPT3,这是一个开源的蛋白质语言模型家族,参数规模覆盖 1.12 亿至 100 亿,并已集成到 Hugging Face 生态系统中。该模型套件同时包含单序列模型和可由多序列比对(MSA)提示驱动的模型,从而能够为生成提供灵活的条件控制。针对不同模型规模和控制设定,我们系统比较了监督微调与使用同源序列进行少样本提示的方法。类似于大语言模型(LLM)通常需要与用户意图进行对齐,我们研究了单序列模型的训练后对齐,并在整个蛋白质组范围内使用序列复杂度和结构置信度指标进行评估。我们发现,对齐在保持序列多样性的同时,减少了低复杂度序列的生成。此外,我们表明,对于受控生成而言,少样本提示是监督微调的一种具有竞争力且更具可扩展性的替代方案。在一个低数据量的脱氟酶案例研究中,ProtGPT3-MSA 的计算成功率高于微调基线模型,并且经实验验证,其生成设计具有可溶性且能够表达。最后,我们通过引入一种基于同源序列的 Feynman--Kac 推理过程,探索了 MSA 模型在推理时计算方面的潜力,以引导蛋白质生成朝向期望目标。我们的模型已公开发布于 https://huggingface.co/collections/AI4PD/protgpt3-family 。

生成式蛋白质语言模型(pLM)使得在广阔的序列空间中探索蛋白质设计成为可能,但如何将生成过程可靠地控制到目标功能家族仍然具有挑战性。尽管蛋白质生成在整体上遵循了自然语言处理(NLP)的发展趋势,但仍有两个方向尚未得到充分探索:其一是使模型行为朝向设计目标优化的对齐方法,其二是在无需微调的情况下于推理时进行基于提示的控制。我们提出了 ProtGPT3,这是一个开源的蛋白质语言模型家族,参数规模从 1.12 亿到 100 亿不等,并已集成到 Hugging Face 生态系统中。该模型套件同时包括单序列模型和可通过多序列比对(MSA)提示的模型,从而能够为生成提供灵活的条件控制。在不同模型规模和控制设定下,我们系统比较了监督微调与利用同源序列进行少样本提示的方法。类似于大语言模型(LLM)通常需要与用户意图进行对齐,我们研究了单序列模型在训练后基于整个蛋白质组的序列复杂度和结构置信度指标进行对齐的方法。我们发现,对齐能够减少低复杂度序列的生成,同时保持序列多样性。

此外,我们表明,在受控生成任务中,少样本提示是一种可与监督微调竞争且更具可扩展性的替代方案。在一个低数据量去氟化酶案例研究中,ProtGPT3-MSA 在计算评估中的成功率高于微调基线模型,并且实验验证表明,其生成的设计具有可溶性且能够实现表达。最后,我们通过提出一种基于同源序列的 Feynman--Kac 推理过程,探索了 MSA 模型在推理时计算方面的潜力,以引导蛋白质生成朝向目标特性。我们的模型已公开发布于 https://huggingface.co/collections/AI4PD/protgpt3-family 。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.06.04.730041v1?rss=1

🏷️ 蛋白质语言模型 蛋白质设计 可控生成 模型对齐 少样本提示 多序列比对