- 14 次围观
酶功能的精确计算预测——以酶学委员会(Enzyme Commission, EC)编号为标准——对于大规模基因组注释和生成式酶设计至关重要。然而,目前尚不清楚最先进的预测器究竟学习到了催化活性的内在结构决定因素,还是仅仅依赖于与已注释同源蛋白的全局序列相似性。为弥补这一空白,我们提出了 EnzymARC,这是一种新的基准数据集,由推定无功能的诱饵序列构成。这些序列通过结构引导下对活性位点的系统性破坏生成,具体是针对实验注释酶的催化残基及其周围半径 5 Å、10 Å 和 15 Å 范围内的区域进行扰动。我们利用该数据集评估了三种不同的预测范式:基于同源性的注释方法(DIAMOND)、结合蛋白质语言模型的对比学习方法(CLEAN),以及纳入非酶判别能力的深度学习模型(DeepEC)。我们的研究结果表明,当前模型对系统发育捷径高度脆弱。对于低扰动诱饵序列,DIAMOND 和 CLEAN 的假阳性率均超过 90%,尽管催化机制已被破坏,它们仍以较高置信度赋予原始 EC 编号。尽管 DeepEC 在较高扰动水平下表现出更好的敏感性,凸显了负样本训练的优势,但所有模型在识别针对性活性位点破坏方面都表现不佳。我们证明,现代 EC 预测器在区分催化能力缺失的变体与功能性酶方面总体上存在显著缺陷;我们进一步提出,在训练和基准测试中整合结构感知的负样本,对于开发在计算酶学中具有功能稳健性的模型至关重要。
酶功能的准确计算预测通常采用酶学委员会(Enzyme Commission, EC)编号进行标准化,这对于大规模基因组注释和生成式酶设计至关重要。然而,目前尚不清楚最先进的预测器究竟学习到了催化活性的内在结构决定因素,还是仅仅依赖于与已注释同源蛋白的全局序列相似性。为填补这一空白,我们引入了 EnzymARC,这是一个新型基准数据集,由通过结构引导、系统性破坏活性位点而生成的推定无功能诱饵序列构成;这些序列来源于具有实验注释的酶,破坏范围针对催化残基及其周围半径 5 Å、10 Å 和 15 Å 的区域。我们利用该数据集评估了三种不同的预测范式:基于同源性的注释方法(DIAMOND)、结合蛋白质语言模型的对比学习方法(CLEAN),以及纳入非酶判别能力的深度学习模型(DeepEC)。我们的研究结果表明,当前模型对系统发育捷径具有很高的脆弱性。对于低扰动诱饵,DIAMOND 和 CLEAN 的假阳性率均超过 90%,尽管催化机制已被破坏,它们仍高置信度地赋予原始 EC 编号。尽管 DeepEC 在更高扰动水平下表现出更好的敏感性,凸显了负训练样本的价值,但所有模型在识别针对性的活性位点破坏方面都表现不佳。我们证明,现代 EC 预测器在区分催化失能变体与功能性酶方面总体上存在明显不足;我们进一步提出,在训练和基准评测中整合结构感知的负样本,对于开发在计算酶学中具有功能鲁棒性的模型至关重要。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.21.746242v1?rss=1
🏷️ 酶功能预测 EC编号注释 基准数据集 蛋白质语言模型 活性位点扰动 结构感知负样本
来源出处
一种用于酶功能预测的新型基准数据集揭示了最先进模型的局限性
https://www.biorxiv.org/content/10.64898/2026.08.21.746242v1?rss=1