学习共享残基背景与修饰特异性偏移用于PTM位点预测

root 提交于 周三, 08/12/2026 - 14:47
翻译后修饰(post-translational modifications, PTMs)是指在翻译完成后添加到蛋白质上的化学变化。这些变化会影响蛋白质的功能与调控,其失调与疾病相关机制密切相关。由于通过实验验证所有可能的修饰位点并不现实,因而已经发展出许多用于PTM位点预测的计算方法。 在本研究中,我们考察了共享模型是否能够在学习修饰特异性的“背景到正例”偏移的同时,表征共同的残基—背景模式。这一建模框架对于赖氨酸(K)等残基尤为重要,因为其可根据周围蛋白质环境的不同发生乙酰化、泛素化、甲基化或SUMO化。我们提出了一种用于基于蛋白质语言模型嵌入进行多类型PTM位点预测的锚点引导校正流匹配框架。对于每一种PTM—残基配对,该模型利用与PTM相容的未注释残基构建残基背景锚点,并利用经实验注释的已修饰残基构建正例锚点。给定一个候选残基和目标修饰类型,模型将该残基嵌入与这些锚点集合进行比较,并利用校正流模块估计一个以修饰类型为条件的“背景到正例”偏移。该偏移与基于锚点的特征相结合,并用于位点评分。 我们在一个源自dbPTM的基准数据集上对该框架进行了评估,该数据集涵盖了六种常见研究的PTM:磷酸化、乙酰化、泛素化、甲基化、SUMO化以及N-连接糖基化。在共享模型设定下,我们的方法取得了0.4195的宏平均AUPRC,优于门控多锚点基线模型的0.4154,而独立训练的逐修饰模型达到了0.4353。上述结果表明,通过结合残基背景锚点与修饰条件偏移特征,可以在单一共享框架内对多类型PTM预测进行建模。

翻译后修饰(PTM)是指在翻译完成后添加到蛋白质上的化学变化。这些变化会影响蛋白质的功能与调控,其紊乱与疾病相关机制密切相关。由于通过实验验证所有可能的修饰位点并不现实,因而已经开发出许多用于PTM位点预测的计算方法。在本研究中,我们探讨一个共享模型是否能够在学习修饰特异性的“背景到正类”偏移的同时,表征通用的残基—背景模式。对于赖氨酸(K)等残基而言,这一建模框架尤为重要,因为其可根据周围蛋白质环境发生乙酰化、泛素化、甲基化或SUMO化。我们提出了一种基于锚点引导的校正流匹配框架,用于基于蛋白质语言模型嵌入进行多类型PTM位点预测。对于每一个PTM—残基配对,该模型利用与PTM兼容的未注释残基构建残基背景锚点,并利用实验注释的已修饰残基构建正类锚点。给定一个候选残基和目标修饰类型,模型将该残基嵌入与这些锚点集合进行比较,并使用校正流模块估计一个以修饰类型为条件的“背景到正类”偏移。该偏移与基于锚点的特征相结合,用于位点评分。我们在一个源自dbPTM的基准数据集上对该框架进行了评估,该数据集涵盖六种常见研究的PTM:磷酸化、乙酰化、泛素化、甲基化、SUMO化和N-连接糖基化。在共享模型设定下,我们的方法取得了0.4195的宏平均AUPRC,优于门控多锚点基线模型的0.4154,而针对每种修饰独立训练的模型则达到了0.4353。这些结果表明,通过结合残基背景锚点与修饰条件偏移特征,可以在单一共享框架内对多类型PTM预测进行建模。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.05.743079v1?rss=1

🏷️ 翻译后修饰 PTM位点预测 蛋白质语言模型 多任务学习 校正流匹配 蛋白质序列分析