MetaHarmonizer:稳健的生物医学元数据协调,以及一种用于控制公共基准上大语言模型性能虚高的污染防控方法

root 提交于 周四, 06/18/2026 - 14:47
公共生物医学存储库蕴含着可观的再利用潜力,但不一致的元数据经常阻碍跨研究整合。近期基于大语言模型(LLM)的协调方法在规模化方面有所突破,但仍存在非确定性、产生幻觉式本体术语的问题,并且在其最高准确率配置下,还依赖专有 API 或带标注的微调数据。一个更根本的问题在于:LLM 在广泛使用的公共基准上的准确率,可能显著高估其可迁移能力。在我们开发的污染控制评估协议下,GDC 模式映射基准上表面存在的“仅用 LLM”的优势被逆转,而且五个 LLM 中有三个仅凭零模式上下文即可恢复 80–100% 的 GDC 标识符,这表明其可能存在直接记忆。 基于这一认识,我们提出了 MetaHarmonizer,一种在设计上即具备稳健性的自动化元数据协调系统:SchemaMapper 用于跨模式对齐属性名称,OntologyMapper 用于将取值标准化到受控词汇表。两个模块均实现了多阶段级联机制,只有在前一阶段方法不足以完成任务时,才升级到计算资源开销更大的方法;所有候选结果都锚定于预先定义的受控词汇表,从而避免产生幻觉式输出;LLM 仅被用作有界的预处理组件,而非推理时依赖。 在 GDC 模式匹配基准上,采用面向部署优化的 LLM 生成别名字典时,SchemaMapper 达到了 71.6% 的 Top-1 准确率,并获得高于 Magneto 二分图变体的 Recall@GT,恢复了显著更多的真实映射;采用表现最佳的别名字典时,其 Top-1/Top-5/Recall@GT 均达到最高,同时在 MRR 上也与最佳的 Magneto 重排序器(经微调的 LLM 重排序器)持平;此外,在污染控制条件下,它的表现也优于仅使用 LLM 的方法。 在四个 EFO 基准上,OntologyMapper 取得了 77.9–95.5% 的 Top-1 准确率,相较于 text2term 最多提升 16.4 个百分点,相较于直接 LLM 推理(针对较小语料库)提升 19.2 个百分点,因为对该任务而言,记忆并不是一种可行的捷径。在两个模块中,经校准的置信度分数都能够区分正确与错误预测(AUC 0.73–0.94),从而支持有原则的人机协同分流。 该方法的推理过程完全在本地运行、具有确定性且计算效率高——模式映射只需数秒,而针对预索引的 33,230 词条语料库,对多达约 7,000 个术语进行本体映射也只需不到一分钟。MetaHarmonizer 以 Python 包形式发布,并采用领域无关的架构,为提升生物医学数据的 FAIR 性并实现跨研究整合提供了可扩展的基础;与此同时,它还提供了一种可适用于任何建立在公共基准之上的 LLM 增强型生物信息学基准的评估方法学。

公共生物医学数据库蕴含着巨大的复用潜力,但不一致的元数据经常阻碍跨研究整合。近期基于大语言模型(LLM)的协调方法在规模化方面有所突破,但存在非确定性、生成虚构本体术语的问题;而且在其最高准确率配置下,还依赖专有 API 或带标签的微调数据。一个更根本的担忧在于:LLM 在广泛使用的公共基准上的准确率,可能会显著高估其可迁移能力。基于我们开发的污染控制评估协议,GDC 模式映射基准上表面存在的“仅用 LLM”优势被逆转;五个 LLM 中有三个在零模式上下文下可恢复 80–100% 的 GDC 标识符,这表明其可能存在直接记忆。

基于这一发现,我们提出了 MetaHarmonizer,这是一种自动化元数据协调系统,在设计上即具备鲁棒性:SchemaMapper 用于在不同模式之间对齐属性名称,OntologyMapper 用于将数值标准化到受控词表。两个模块都实现了多阶段级联机制,仅在前一阶段效果不足时才升级到资源消耗更高的方法;所有候选结果都以预定义受控词表为基础,从而避免生成虚构输出,而 LLM 仅被用作有界的预处理组件,而非推理时依赖。

在 GDC 模式匹配基准上,采用面向部署优化的 LLM 生成别名字典时,SchemaMapper 实现了 71.6% 的 Top-1 准确率,并取得了高于 Magneto 二分图变体的 Recall@GT,能够恢复显著更多的真实映射;在使用表现最佳的别名字典时,它达到了最高的 Top-1/Top-5/Recall@GT,并且在 MRR 上也与最佳 Magneto 重排序器(经过微调的 LLM 重排序器)持平;同时,在污染控制条件下,它也优于仅用 LLM 的表现。在四个 EFO 基准上,OntologyMapper 实现了 77.9–95.5% 的 Top-1 准确率,相比 text2term 最多提升 16.4 个百分点,相比直接 LLM 推理(针对较小语料库)提升 19.2 个百分点,因为对于该任务而言,记忆并不是可行的捷径。

在两个模块中,经校准的置信度分数能够区分正确与错误预测(AUC 0.73–0.94),从而支持原则性的人机协同分流。整个推理过程完全本地化、确定性且计算高效——模式映射仅需数秒,而针对预索引的 33,230 词条语料库,对最多约 7,000 个术语进行本体映射也只需不到一分钟。MetaHarmonizer 以 Python 软件包形式发布,采用与领域无关的架构,为提升生物医学数据的 FAIR 性以及实现跨研究整合提供了可扩展的基础,同时也提供了一种适用于任何构建于公共基准之上的 LLM 增强型生物信息学基准的评估方法。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.06.13.732088v1?rss=1

🏷️ 生物医学元数据 元数据协调 大语言模型 本体映射 污染控制评估 模式匹配