通过外部验证评估大语言模型生成的表型—基因型关联的可靠性

root 提交于 周三, 08/19/2026 - 12:47
背景:表型-基因型关联是精准医学的基础,它能够促进疾病预防、早期诊断、风险分层、治疗靶点发现以及个体化治疗。然而,科学证据的快速增长使得这些关联的人工整理日益变得劳动密集、耗时且不完整。大语言模型(LLMs)为该类知识的可扩展生成与综合提供了一条潜在路径,但其准确识别表型-基因型关联的能力,以及这些输出在多大程度上能够得到既有基因组学知识库支持,仍不明确。 材料与方法:对四种大语言模型——Claude Sonnet 4.6、DeepSeek V4 Flash、Gemini 3 Flash Preview 和 GPT-5.5——进行了基准测试,涵盖六类零样本任务,包括正向和反向的表型-基因及表型-SNP生成。共从整理后的输入中识别出4,196个关联,并通过一个多阶段外部验证流程进行评估,该流程包括表型标准化、本体映射、基于 Ensembl 的基因组标识符验证,以及利用 GWAS Catalog 和 OMIM 进行证据验证。根据融合证据水平,将这些关联划分为强、中等、弱或无支持。 结果:总体而言,74.19%的生成关联可匹配到至少一个外部基因组学知识库;其中9.15%获得强支持,54.46%获得中等支持。表型-基因关联比表型-SNP关联更易于验证(强或中等支持:67.19% 对 54.06%)。在已有关联中,Claude Sonnet 4.6 的总体强或中等支持率最高(69.2%),其次是 GPT-5.5(65.1%)、DeepSeek V4 Flash(61.7%)和 Gemini 3 Flash Preview(56.9%)。 结论:大语言模型能够支持候选表型-基因型关联的可扩展生成。其性能因关系类型而存在显著差异,在 SNP 水平和罕见病关联上的表现较低,这既凸显了当前基因组学资源的局限性,也表明了建立严格验证流程的必要性。 关键词:大语言模型;临床基因组学;表型-基因型关联;外部验证;基因组学知识库

背景:表型—基因型关联是精准医学的基础,它能够促进疾病预防、早期诊断、风险分层、治疗靶点发现以及个体化治疗。然而,科学证据的快速增长使得此类关联的人工整理日益劳动密集、耗时且不完整。大型语言模型(LLM)为该类知识的可扩展生成与综合提供了潜在路径,但其能否准确识别表型—基因型关联,以及这些输出在多大程度上能够得到既有基因组学知识库的支持,仍不明确。

材料与方法:对四种大型语言模型——Claude Sonnet 4.6、DeepSeek V4 Flash、Gemini 3 Flash Preview 和 GPT-5.5——在六类零样本任务上进行了基准评测,这些任务涵盖正向和反向的表型—基因及表型—SNP 生成。共从整理后的输入中识别出 4,196 个关联,并通过一个多阶段外部验证流程进行评估,该流程包括表型标准化、本体映射、基于 Ensembl 的基因组标识符验证,以及利用 GWAS Catalog 和 OMIM 进行的证据验证。各关联被赋予融合证据等级:强、中等、弱或无。

结果:总体而言,74.19% 的生成关联可与至少一个外部基因组学知识库匹配;其中 9.15% 获得强支持,54.46% 获得中等支持。表型—基因关联比表型—SNP 关联更易于验证(强或中等支持:67.19% 对 54.06%)。在已有关联中,Claude Sonnet 4.6 的总体强或中等支持率最高(69.2%),其次为 GPT-5.5(65.1%)、DeepSeek V4 Flash(61.7%)和 Gemini 3 Flash Preview(56.9%)。

结论:大型语言模型能够支持候选表型—基因型关联的可扩展生成。其性能因关联类型而存在显著差异,并且在 SNP 水平和罕见病关联上的表现较低,这既凸显了当前基因组学资源的局限性,也表明需要严格的验证流程。

关键词:大型语言模型;临床基因组学;表型—基因型关联;外部验证;基因组学知识库


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.13.744701v1?rss=1

🏷️ 大语言模型 表型-基因型关联 外部验证 临床基因组学 GWAS Catalog