KRAKEN:用于多组学与健康研究的来源可追踪知识图谱

root 提交于 周日, 08/23/2026 - 18:47
现有通用生物医学知识图谱往往侧重于疾病机制和药物再利用,而对多组学及与健康相关的内容覆盖不足。KRAKEN(Knowledge Research & Analysis Kit for Evidence Networks,知识研究与证据网络分析工具包)通过整合现有图谱(包括 Translator KG Open、RTX-KG2 和 ROBOKOP)以及 RefMet、LIPID MAPS、NIH Common Data Elements、Polygenic Score Catalog 等专门数据源,并纳入生物年龄和生物 BMI 等衍生健康指标,弥补了这一空白。由此生成的图谱涵盖约 1500 万个节点和 1.13 亿条边,涉及 62 种实体类型。KRAKEN 采用 Biolink Model 作为其语义层,确保与 NIH NCATS Biomedical Data Translator 计划中新兴的标准化资源兼容。其轻量级、模块化构建系统可重建完整图谱(包括实体解析),峰值内存消耗低于 48 GB,并支持灵活地包含或排除各数据源,使用户能够将图谱限定于特定研究领域。内置分析工具包括多跳推理、子图提取、文本、向量及混合实体检索,以及富集分析;这些功能均可通过交互式网页界面、REST API 和 Model Context Protocol 服务器访问,后者可使代理系统和基于 LLM 的系统直接调用。KRAKEN 可在 https://app.krakenkg.com 免费获取。

现有通用生物医学知识图谱往往侧重于疾病机制和药物再利用,而对多组学及与健康生活方式相关的内容关注不足。KRAKEN(Knowledge Research & Analysis Kit for Evidence Networks)通过整合现有图谱(包括 Translator KG Open、RTX-KG2 和 ROBOKOP)以及专门数据源(如 RefMet、LIPID MAPS、NIH Common Data Elements、Polygenic Score Catalog),并纳入推导得到的健康指标(包括生物学年龄和生物学 BMI),弥补了这一空白。由此形成的图谱涵盖约 1500 万个节点和 1.13 亿条边,跨越 62 种实体类型。KRAKEN 采用 Biolink Model 作为其语义层,从而确保与 NIH NCATS Biomedical Data Translator 项目中不断涌现的标准化资源兼容。该系统采用轻量级、模块化的构建框架,可重建完整图谱(包括实体消歧),峰值内存占用低于 48 GB,并支持对数据源进行灵活的包含或排除,使用户能够将图谱范围限定于感兴趣的领域。内置分析工具包括多跳推理、子图提取、文本、向量及混合实体检索,以及富集分析;这些功能均可通过交互式网页界面、REST API 和 Model Context Protocol 服务器访问,其中后者支持代理式系统和基于 LLM 的系统直接调用。KRAKEN 可在 https://app.krakenkg.com 免费获取。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.18.745544v1?rss=1

🏷️ 多组学知识图谱 生物医学知识图谱 健康研究 证据网络 实体解析 富集分析