数据一致性而非数据量驱动基于基因组的微生物碳利用泛化预测

root 提交于 周四, 08/13/2026 - 04:47
微生物碳利用是一种基础性的生态表型,尽管相关通路已得到充分表征,但仍然难以仅凭基因组进行预测。机器学习模型在跨数据集推广时表现不佳,这一失败通常被归因于训练集规模和分类学偏倚。为检验这一观点,我们整合了来自四个数据集的二元生长表型数据,涵盖819个菌株在240种碳源上的表现。平衡准确率在数据集内部为0.86,而跨数据集时下降至0.62;对近缘菌株进行测试仅能挽回其中0.03的降幅,因此,机制上不一致的基因型—表型关系驱使模型依赖与数据集相关的捷径。将训练限制于一致样本(即测得的生长情况与其注释通路相匹配)后,跨数据集中能够恢复已知通路基因的碳源数量增加了一倍(15种中由6种增至12种);而采用规模匹配的随机子集则未出现这一结果。向训练集中加入超过8000个经文献整理的 BacDive 基因组,并未比规模更小的一致样本集更能提升跨数据集表现,这表明一致性比数据量更为重要。由于此类筛选需要一个机制性预测器,我们测试了一种无机制替代方案,将系统发育一致性与实验标签相结合;该方法恢复了部分性能提升,但未能获得召回率方面的优势。一致性训练的模型是受限的专门模型,在挽救机制性假阴性方面的频率是挽救假阳性的两倍多(44% 对 19%),其中大多为代谢广谱型菌株。为界定这些边界,研究利用模型置信度定义了适用域,并发现优先选择低置信度基因组纳入训练,相较于随机采样或基于多样性的采样,更能提高跨数据集准确率,尤其对于较弱的表型更为明显。这一结果将生物学机器学习中的泛化问题重新界定为标签—机制一致性与适用域定义的问题,并将其与数据量和算法选择并列看待。

微生物碳利用是一种基础性的生态表型,尽管其相关通路已得到较为充分的表征,但仍然难以仅凭基因组进行预测。机器学习模型在跨数据集泛化时表现较差,这种失败通常归因于训练集规模不足和分类学偏倚。为检验这一点,我们整合了来自四个数据集的二元生长表型数据,涵盖819个菌株和240种碳源。平衡准确率在数据集内为0.86,而跨数据集下降至0.62;即使仅在近缘菌株上测试,也只能恢复其中0.03的下降幅度,因此,机制上不一致的基因型—表型关系促使模型依赖与数据集相关的捷径。将训练限制于一致性样本(即实测生长与其注释通路相匹配)后,跨数据集恢复已知通路基因的碳源数量增加了一倍(15种中由6种增至12种),而规模匹配的随机子集则未出现这种提升。向训练集中加入超过8000个经文献整理的 BacDive 基因组后,其对跨数据集性能的提升并未超过更小的一致性子集,这表明一致性比数据量更为重要。由于此类筛选需要一个机制性预测器,我们进一步测试了一种不依赖机制的替代方案,即结合系统发育一致性与实验标签;该方法恢复了部分性能增益,但未能获得召回率优势。基于一致性训练的模型属于受限的专门型模型,它们在挽救机制性假阴性方面的频率是挽救假阳性的两倍以上(44% 对 19%),且这些样本大多为代谢广谱型菌株。为界定这种边界,我们利用模型置信度定义了适用域,并优先选择低置信度基因组纳入训练;与随机采样或基于多样性的采样相比,这种策略对提升跨数据集准确率更为有效,尤其对于较弱的表型更是如此。这一结果将生物机器学习中的泛化问题重新界定为标签—机制一致性与适用域定义的问题,并将其与数据量和算法选择置于同等重要的位置。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.06.743333v1?rss=1

🏷️ 微生物碳利用 基因型-表型预测 机器学习泛化 数据一致性 基因组学 适用域