面向 OMOP 通用数据模型的可定制且高效的数据协调引导式人工智能框架

root 提交于 周四, 08/13/2026 - 22:47
将来自不同来源的临床数据在 OMOP 通用数据模型(CDM)内实现相互“对话”,可以说是多中心研究中最繁琐的部分。尽管这种整合至关重要,但数据转换过程往往仍是高度依赖人工的繁重工作,需要深厚的临床知识与技术专长这两者罕见的交叉能力。本文提出了一个框架,旨在通过两个不同步骤实现数据协调自动化,从而减轻研究人员的部分负担:结构化模式映射和术语标准化。 在结构化映射方面,我们摒弃了“黑箱”逻辑,转而采用由大型语言模型(LLM)和有向无环图管理的有状态工作流。通过在源端对电子健康记录(EHR)数据进行特征分析,我们的系统能够生成具备上下文感知能力的数据字典,提供带有置信评分的排序映射建议。尽管我们的基准测试显示,与人工专家相比,该系统在模式层面的匹配一致率达到 97.5%,在数值层面的匹配一致率达到 84%,但该系统在作为“副驾驶”而非完全替代人工监督的情况下似乎最为有效。 为处理数值层面的标准化,我们实现了一种混合检索策略,将 SapBERT 嵌入的语义深度与模糊字符串匹配的字面精确性相结合。通过使用 FAISS 进行快速相似性检索,该引擎尝试将杂乱或“噪声”较多的临床描述解析为标准 OMOP 概念。这种方法在处理较小规模本地数据集中常见的非标准化标签时,似乎尤其具有应用前景。 最终,我们的结果表明,这种引导式方法能够将符合 OHDSI 规范的数据仓库构建周期,从数周的人工整理缩短为更易管理且更具可扩展性的流程,并有望降低小型研究团队的准入门槛。

将来自不同来源的临床数据在 OMOP 通用数据模型(CDM)内实现彼此“对话”,可以说是多中心研究中最繁琐的部分。尽管这种整合至关重要,但转换过程往往仍是一项高度依赖人工的繁重工作,需要临床深度知识与技术专长这两种少有重叠的能力。在本文中,我们提出了一个框架,旨在通过两个不同步骤的数据协调自动化来减轻研究人员的部分负担:结构化模式映射和术语标准化。对于结构化部分,我们摒弃了“黑箱”逻辑,转而采用由大语言模型(LLM)和有向无环图管理的有状态工作流。通过在源端对电子健康记录(EHR)数据进行分析,我们的系统能够生成具备上下文感知能力的数据字典,并提供带有置信度评分的排序映射建议。尽管我们的基准测试显示,在与人工专家比较时,该系统在模式层面的匹配一致率达到 97.5%,在取值层面的匹配一致率达到 84%,但当其被视为“副驾驶”而非完全替代人工监督的工具时,似乎最为有效。

为处理取值层面的标准化,我们实现了一种混合搜索策略,将 SapBERT 嵌入的语义深度与模糊字符串匹配的字面精确性相结合。通过使用 FAISS 进行快速相似性检索,该引擎尝试将杂乱或“噪声化”的临床描述解析为标准 OMOP 概念。这种方法在处理较小型本地数据集中经常存在的非标准化标签时,似乎尤其具有应用前景。最终,我们的结果表明,这种引导式方法可以将符合 OHDSI 要求的数据仓储建设时间,从数周的人工整理转变为一个更易管理且可扩展的流程,从而有望降低小型研究团队的准入门槛。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.07.742453v1?rss=1

🏷️ OMOP通用数据模型 临床数据协调 电子健康记录 大型语言模型 术语标准化 FAISS检索