基于计算稳定性数据迁移学习的纳米抗体熔解温度预测

root 提交于 周三, 08/05/2026 - 20:47
纳米抗体的热稳定性决定了其能否被可靠地表达、纯化和储存,然而测量大量序列的熔解温度(Tm)成本高昂。模拟能够产生与稳定性相关的量,但无法直接给出 Tm,因此仍存在两个未决问题:哪一种量,以及哪些序列,最能够帮助数据受限的 Tm 模型。我们通过一个多任务模型同时解决这两个选择问题:该模型利用共享的 ESM2 编码器(可冻结或微调)预测 Tm,并同时学习一个计算得到的性质作为辅助目标。训练使用了 57 条具有 Tm 的序列,序列选择与评估均在相互独立的留出序列上进行。 在固定所计算量的情况下,两个分子动力学(MD)数据集采用了相同的 400 K 协议和天然接触定义,但覆盖的序列不同,其表现也不同。一个在序列上更多样化的纳米抗体结构集合在微调后将平均绝对误差(MAE)降低了 0.30 °C,而对两个固定结构进行单点突变扫描的数据集在两种编码器设置下都没有带来帮助。 在将序列固定为同一组完全相同的突变时,自由能微扰(FEP)在两种编码器下都取得了最低的测试 MAE。它是唯一一种在两种编码器中都能显著降低误差的计算标签,最大降幅达到 0.37 °C。在经验性 ΔΔG 估计方法中,FoldX 也降低了冻结编码器的误差,并且优于 Rosetta。 尽管没有任何一种计算标签本身就是 Tm,但当作为辅助任务提供时,相对 ΔΔG 仍能改进对绝对 Tm 的预测。因此,性能提升取决于所选择的序列和所计算的量,而不是标签的数量。这两者都在任何模拟运行之前就已确定,并且从一开始就应与预测任务尽可能保持一致。

纳米抗体的热稳定性决定了其表达、纯化和储存的可靠性,但测量大量序列的熔解温度(Tm)成本高昂。模拟能够产生与稳定性相关的量,但无法直接给出 Tm,因此仍不清楚哪一种量以及哪些序列最能帮助数据受限的 Tm 模型。我们采用一个多任务模型来同时解决这两个选择问题:该模型基于共享的 ESM2 编码器预测 Tm,编码器可保持冻结或进行微调,同时学习一个计算得到的性质作为辅助目标。训练使用了 57 条 Tm 序列,序列选择和评估则基于彼此独立的保留序列进行。在固定所计算量的情况下,两个分子动力学(MD)数据集采用了相同的 400 K 协议和天然接触定义,但覆盖的序列不同,其表现也不同。一个在序列上具有多样性的纳米抗体结构集合在微调后将平均绝对误差(MAE)降低了 0.30 °C,而对两个固定结构进行的单点突变扫描在任一编码器中都未带来帮助。当将序列固定为同一组完全一致的突变时,自由能微扰(FEP)在两种编码器下都给出了最低的测试 MAE。它是唯一一种在两种编码器中都能显著降低误差的计算标签,最大降幅达 0.37 °C。在经验性 ΔΔG 估计方法中,FoldX 也降低了冻结编码器的误差,并且优于 Rosetta。尽管没有任何计算标签本身就是 Tm,但当相对 ΔΔG 作为辅助任务输入时,却改进了绝对 Tm 的预测。因此,性能提升取决于所选择的序列和所计算的量,而非标签数量。这两者都在任何模拟运行之前就已确定,并且从一开始就应与预测任务保持最佳一致。

T.M. 是 Epsilon Molecular Engineering, Inc. 的员工。Y.M. 是 Epsilon Molecular Engineering, Inc. 的科学顾问。

感谢您关注并帮助传播 bioRxiv 的研究成果。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.30.741744v1?rss=1

🏷️ 纳米抗体 熔解温度预测 迁移学习 多任务学习 蛋白质稳定性 自由能微扰