真实世界文本概念规范化的生物医学语言模型比较基准评测

由 root 提交于 周二, 09/22/2026 - 18:47
患者报告及临床记录中的叙述通常包含非正式、片段化且语言形式多样的表达,这给医学概念标准化(medical concept normalization,MCN)带来了困难,并且常常需要在术语映射之前进行预处理。尽管生物医学语言建模取得了快速进展,但不同表征模型在医学概念标准化中的相对效用,以及其与指令微调大语言模型在自动化标准化流程中的整合方式,仍缺乏充分研究。本研究基于五个已建立的数据集——TAC2017_ADR、TwADR-L、TwiMed、CADEC 和 SMM4H2017——中的12,713个实例,系统评测了15种通用、生物医学和临床领域的基于Transformer的表征模型,以及12种指令微调大语言模型。表征模型采用基于嵌入的语义检索进行评估,而指令微调大语言模型则作为上游文本校正模块进行评估。在未经校正的情况下,SapBERT在表征模型中取得了最高的Top-5准确率,在SNOMED CT和MedDRA上的准确率分别达到63.8%和58.0%。综合考虑Top-1标准化性能与计算效率后,Qwen 2 Instruct被选为首选校正模型;与包括Llama 3.1 Instruct(70B)在内的规模显著更大的模型相比,Qwen 2 Instruct在性能与效率之间实现了更优平衡。引入Qwen 2 Instruct后,SNOMED CT和MedDRA上的Top-5准确率分别提升至69.4%和63.2%。最终形成的框架无需人工进行输入文本预处理,即可接收形式多样的短医学表达,并自动完成文本优化、语义检索以及向标准化概念和词汇代码的术语映射。这些结果建立了一个以基准评测为指导、具有可扩展性的自动化医学术语标准化框架。

患者报告及临床记录中的叙述通常包含非正式、碎片化且语言表达异质性较高的表述,这给医学概念标准化(medical concept normalization,MCN)带来了困难,并且通常需要在术语映射之前进行预处理。尽管生物医学语言建模取得了快速进展,但不同表征模型在 MCN 中的相对效用,以及其与指令微调大语言模型(LLM)在自动化标准化流程中的整合方式,仍缺乏充分研究。本研究基于五个成熟数据集——TAC2017_ADR、TwADR-L、TwiMed、CADEC 和 SMM4H2017——涵盖的 12,713 个实例,系统评测了 15 个通用、生物医学和临床领域的基于 Transformer 的表征模型,以及 12 个指令微调 LLM。表征模型采用基于嵌入的语义检索进行评估,而指令微调 LLM 则作为上游文本纠错模块进行评估。在未进行纠错的情况下,SapBERT 在表征模型中取得了最高的 Top-5 准确率:在 SNOMED CT 和 MedDRA 中分别达到 63.8% 和 58.0%。基于其在 Top-1 标准化性能与计算效率之间表现出的良好平衡,Qwen 2 Instruct 被选为首选纠错模型;与规模显著更大的模型(包括 Llama 3.1 Instruct(70B))相比,Qwen 2 Instruct 具有更优的综合表现。引入 Qwen 2 Instruct 后,Top-5 准确率在 SNOMED CT 和 MedDRA 中分别提升至 69.4% 和 63.2%。所构建的框架无需人工进行输入文本预处理,即可接收异质性的短医学表达,并自动完成文本优化、语义检索,以及将其映射至标准化概念和术语编码。上述结果确立了一个以基准评测为指导、具有可扩展性的自动化医学术语标准化框架。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.19.752843v1?rss=1

🏷️ 医学概念规范化 生物医学语言模型 自然语言处理 大语言模型 语义检索 SNOMED CT与MedDRA