- 2 次围观
蛋白质功能预测中的性能估计不仅取决于模型选择,还取决于界定学习问题的上游决策。我们以抗氧化蛋白分类作为一个受控案例研究,评估了数据集协调、蛋白质表征、冗余控制以及划分策略如何影响蛋白质机器学习流程。我们整合了来自12个公开可用数据集条目的18,804条记录,构建了一个经过整理的共识数据集,包含4,193条蛋白质序列。我们评估了独热编码和六种预训练蛋白质语言模型表征,既将其作为模型输入,也将其作为用于冗余减少和距离感知划分的相似性空间。表征选择显著改变了数据集几何结构、保留的数据集规模、类别平衡以及下游评估结果。在表征特异性的 p90 阈值下,独热编码保留了完整数据集,而预训练嵌入仅保留了 5% 至 25% 的序列。在冗余控制之前,与随机划分相比,距离感知划分使表观性能最多降低了 0.15 的 MCC;而在相似性过滤之后,这种差异有所缩小。尽管如此,所选配置在更严格的评估下仍保持了较高性能,MCC 达到 0.84。上述发现表明,性能估计应被理解为完整数据中心工作流程的结果,而非预测模型孤立属性的体现。
蛋白质功能预测中的性能估计不仅取决于模型选择,还取决于界定学习问题的上游决策。我们以抗氧化蛋白分类作为一个受控案例研究,评估了数据集协调统一、蛋白质表征、冗余控制以及划分策略如何影响蛋白质机器学习流程。我们将来自12个公开可用数据集条目的18,804条记录整合为一个经整理的共识数据集,包含4,193条蛋白质序列。我们评估了独热编码和六种预训练蛋白质语言模型表征,既将其作为模型输入,也将其作为用于冗余消减和距离感知划分的相似性空间。表征选择显著改变了数据集的几何结构、保留的数据集规模、类别平衡以及下游评估。在表征特异性的 p90 阈值下,独热编码保留了完整数据集,而预训练嵌入仅保留了5%至25%的序列。在冗余控制之前,与随机划分相比,距离感知划分使表观性能最高下降了0.15 MCC;而在相似性过滤之后,这一差异有所缩小。尽管如此,所选配置在更严格的评估下仍保持了较高性能,MCC达到0.84。这些发现表明,性能估计应被解释为以数据为中心的完整工作流程的结果,而不是预测模型孤立属性的体现。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.05.742971v1?rss=1
🏷️ 蛋白质功能预测 机器学习评估 蛋白质语言模型 冗余控制 数据集构建
来源出处
以数据为中心的蛋白质功能预测流程评估
https://www.biorxiv.org/content/10.64898/2026.08.05.742971v1?rss=1