- 2 次围观
研究动机 蛋白质语言模型(PLMs)已成为基于序列进行蛋白质功能预测的强大工具,然而,对于冻结嵌入、低秩适配(LoRA)等微调策略以及经典机器学习(ML)方法之间的系统性基准比较仍然有限。我们对四种机器学习策略进行了基准评测:使用氨基酸描述符的机器学习(SL-AAFeat)、使用来自20种PLM并结合多种池化策略的冻结嵌入的机器学习(SL-Embed)、全模型微调(FT-Full)以及基于LoRA的微调(FT-LoRA)。模型性能在内部构建的VHH噬菌体展示数据集(VHH)上用于结合亲和力预测,并在TAPE荧光数据集(FLS和FLS10)上用于突变效应预测进行了评估。 结果 模型性能在很大程度上依赖于数据集及其适配策略。最大池化持续提升了基于嵌入的模型性能,而氨基酸描述符在特定数据集和资源受限条件下仍具有竞争力。微调通常能够提供最高的预测性能,但这种优势并非普遍适用。超参数优化显著提升了FT-LoRA的性能,使其在仅适配不到10%模型参数的情况下,于VHH数据集上优于FT-Full。相比之下,FT-Full在FLS和FLS10上取得了最佳性能。若干中等规模的PLM表现与更大模型相当,突显了其在性能—效率权衡方面的优势。总体而言,本文对PLM的利用策略进行了全面综述,并就如何根据数据集特征和可用计算资源选择合适策略提出了实用建议。 可获得性 本文所使用的源代码已存储于Zenodo代码仓库中,地址为:https://doi.org/10.5281/zenodo.21466255。
研究动机 蛋白质语言模型(PLMs)已成为基于序列进行蛋白质功能预测的强大工具,然而,对冻结嵌入、低秩适配(LoRA)等微调策略以及经典机器学习(ML)方法进行系统比较的基准研究仍然有限。我们对四种机器学习策略进行了基准评估:使用氨基酸描述符的机器学习(SL-AAFeat)、使用来自20种PLM并结合多种池化策略的冻结嵌入的机器学习(SL-Embed)、全模型微调(FT-Full)以及基于LoRA的微调(FT-LoRA)。性能评估基于内部构建的VHH噬菌体展示数据集(VHH),用于结合亲和力预测;以及TAPE荧光数据集(FLS和FLS10),用于突变效应预测。
结果 模型性能在很大程度上取决于数据集和适配策略。最大池化持续提升了基于嵌入的模型性能,而氨基酸描述符在特定数据集和资源受限条件下仍保持竞争力。微调通常能够提供最高的预测性能,但这一优势并非普遍成立。超参数优化显著提升了FT-LoRA的性能,使其在VHH数据集上仅适配不到10%的模型参数时即可优于FT-Full。相比之下,FT-Full在FLS和FLS10上取得了最佳性能。若干中等规模的PLM表现与更大模型相当,凸显了性能—效率权衡方面的优势。总体而言,本文对PLM的利用策略进行了全面综述,并就如何根据数据集特征和可用计算资源选择合适策略提出了实用建议。
可获取性 本文所使用的源代码可在Zenodo存储库中获取,网址为 https://doi.org/10.5281/zenodo.21466255。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.02.737389v1?rss=1
🏷️ 蛋白质功能预测 蛋白质语言模型 轻量级微调 LoRA 机器学习基准评测 突变效应预测