MolJam:一种用于评估分子数据集质量及其对机器学习影响的多维框架

由 root 提交于 周三, 08/26/2026 - 22:47
高质量的分子数据集对于化学信息学和生物信息学中的可靠机器学习至关重要,然而数据集质量很少得到系统评估,其与下游模型性能之间的关系也仍不清楚。在此,我们提出 MolJam,一个开源框架,用于通过 12 项标准化指标,从五个维度——结构完整性、数据质量、实验信息质量、化学空间覆盖度和数据分布——对分子数据集质量进行定量评估。将 MolJam 应用于 11 个 MoleculeNet 数据集和 8 个源自 ChEMBL 的数据集后发现,数据集中存在广泛且异质的质量问题,包括高达 70.72% 的分子具有未定义立体化学、不一致的分子表示以及相互矛盾的标签。随后,我们探究提升这些质量指标是否必然会改善机器学习性能。对 ESOL 和 Lipophilicity 数据集进行精炼后,其 MolJam 质量评分提高,但对预测性能的影响不一,表明数据集规模缩减可能产生竞争性影响。进一步的受控消融实验表明,数据集质量和数据量均会影响模型性能;值得注意的是,当保留立体化学信息不完整的分子所带来的数据量增益足以抵消质量惩罚时,其表现可能优于将其移除。因此,分子数据集整理不能仅仅简化为最大化数据洁净度,而必须在数据质量的多个维度与信息损失之间取得平衡。MolJam 提供了一个标准化框架,用于诊断分子数据集局限性、比较基准数据集质量,并定量评估数据整理决策如何影响下游机器学习。

高质量分子数据集对于化学信息学和生物信息学中的可靠机器学习至关重要,然而数据集质量很少得到系统评估,其与下游模型性能之间的关系也仍未被充分理解。在此,我们提出 MolJam,这是一个开源框架,用于通过五个维度——结构完整性、数据质量、实验信息质量、化学空间覆盖度和数据分布——并采用 12 项标准化指标,对分子数据集质量进行定量评估。将 MolJam 应用于 11 个 MoleculeNet 数据集和 8 个源自 ChEMBL 的数据集后发现,存在广泛且异质的质量问题,包括高达 70.72% 的分子具有未定义立体化学、分子表示不一致以及标签相互矛盾。随后,我们考察提升这些质量指标是否必然改善机器学习性能。对 ESOL 和 Lipophilicity 数据集的精炼提高了其 MolJam 质量评分,但对预测性能的影响不一,表明数据集规模缩减可能产生竞争性影响。受控消融实验进一步表明,数据集质量和数据数量均会影响模型性能;值得注意的是,在因保留立体化学信息不完整的分子而获得的数据量增益足以抵消质量惩罚时,保留这些分子可能优于将其移除。因此,分子数据集整理不能仅仅简化为追求数据洁净度最大化,而必须在多个数据质量维度与信息损失之间进行权衡。MolJam 提供了一个标准化框架,用于诊断分子数据集的局限性、比较基准数据集质量,并定量评估数据整理决策如何影响下游机器学习。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.21.746384v1?rss=1

🏷️ 分子数据集质量 化学信息学 机器学习评估 数据集整理 化学空间覆盖