MHChron:面向MHC I类和II类的稳健肽-MHC结合预测的多样性平衡数据集设计

由 root 提交于 周四, 08/06/2026 - 14:47
肽-MHC(pMHC)结合的准确预测是免疫原性评估的核心,然而,许多现有预测器的训练和评估都局限于狭窄的等位基因集合和受限的肽长度范围。在此,我们提出MHChron,这是一个统一的pMHC结合预测框架,其基础在于系统化的数据整理、对数据集平衡性与多样性的精细工程设计,以及通过谨慎的数据划分并控制数据泄漏所进行的严格评估。我们构建了迄今报道中最多样化的pMHC训练数据集之一,整合了公开可获得的结合数据,覆盖广泛的等位基因范围(I类 n=214,II类 n=98)和肽长度区间(8至36个残基)。基于该数据集一个聚焦且经精心采样的子集,我们训练了互补的基于序列和结构感知的模型,并在逐步更加严格的泛化条件下对其进行测试。两种模型均表现出持续稳健的性能,尽管训练所用数据点在数量上更少,但仍优于所评估的当前最先进预测器。值得注意的是,除在对未见等位基因簇进行外推这一最具挑战性的设定下外,结构感知模型并未始终优于基于序列的模型,这表明性能提升主要源于数据集的多样性和严格的评估,而非模型架构的复杂性。基于序列的MHChron已随可复现的安装方案和自动化全蛋白筛选流程一并发布,从而支持其广泛且实用的应用。

对肽-MHC(pMHC)结合的准确预测是免疫原性评估的核心,然而,许多现有预测器是在狭窄的等位基因集合和受限的肽长度范围上进行训练和评估的。在此,我们提出MHChron,这是一种统一的pMHC结合预测框架,其建立基础在于系统化的数据整理、对数据集平衡性与多样性的精细工程设计,以及通过谨慎的数据划分来控制数据泄漏并实施严格评估。我们构建了迄今报道中最多样化的pMHC训练数据集之一,整合了公开可获得的结合数据,覆盖广泛的等位基因范围(I类 n=214,II类 n=98)以及肽长度范围(8至36个残基)。基于该数据集一个经过聚焦且精心采样的子集,我们训练了互补的基于序列和结构感知的模型,并在逐步提高严格程度的泛化设定下对其进行测试。两类模型均表现出持续强劲的性能,尽管训练所用数据点在数量上更少,却优于所评估的当前最先进预测器。值得注意的是,除在对未见等位基因簇进行外推这一最具挑战性的设定下外,结构感知模型并未持续优于基于序列的模型,这表明性能提升主要源于数据集的多样性和严格评估,而非模型架构的复杂性。基于序列的MHChron已发布,并提供可复现的安装方式以及自动化的全蛋白筛选流程,从而支持广泛且实用的应用。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.30.741752v1?rss=1

🏷️ 肽-MHC结合预测 数据集构建 MHC I/II 免疫原性评估 泛化能力 结构感知模型