从代码到自然语言:MErlin——以 Claude 智能体技能形式提供的细菌表观基因组学多组学工具包

root 提交于 周一, 09/07/2026 - 18:47
解读细菌甲基化组是一个多组学问题,需要将修饰碱基识别结果与基因组注释、基序清单、甲基转移酶基因型、转录本丰度、复制体位置以及日益受到重视的染色体构象进行整合。这些数据类型通常以彼此不兼容的格式生成,采用不一致的序列和基因标识符,并且来源于不同的分析流程。相关算法虽然已经具备,但如何将其组装为连贯且具有统计学依据的分析流程,仍然是一个重大的数据整合与接口问题。 我们提出了 MErlin(Methylation-driven Expression & Regulation Linkage in Interacting Nuclear-domains,甲基化驱动的表达与调控关联分析工具),这是一套多组学工具包,由十七个可组合模块构成,能够处理从碱基识别后的 modBAM 文件到基因层面证据排序及自包含 HTML 报告的完整流程。MErlin 既以常规 Python 软件包的形式发布,也以代理技能(agent skill)的形式提供:后者是一种结构化、版本受控的程序性知识层,使兼容的大语言模型(LLM)助手能够选择并运行经过审计的软件包,而无需针对每项请求重新生成分析实现。这种设计将自然语言视为固定分析操作的接口,而不是经过测试的科学软件的替代品。该技能编码了模块选择规则、强制性预检验、人类必须参与回答的问题、从实验设计到统计推断的约束条件,以及结果解读指南。 我们介绍了 MErlin 的架构与统计方法,利用包含预设真实结果的合成数据集对其进行了验证,并以恶臭假单胞菌(*Pseudoalteromonas haloplanktis*)TAC125 的真实甲基化组—转录组比较为例,展示了其对话式接口。MErlin 采用开源许可发布,项目地址为:https://github.com/IacopoPasseri/MErlin

解读细菌甲基化组是一个多组学问题。这要求将修饰碱基识别结果与基因组注释、基序清单、甲基转移酶基因型、转录本丰度、复制臂位置以及日益受到关注的染色体构象进行整合。这些数据类型通常以相互不兼容的格式生成,使用不一致的序列和基因标识符,并且来源于不同的分析流程。尽管相关算法均已具备,但要将其组装为连贯且具有统计学依据的分析流程,仍然是一个重大的数据整合与接口问题。我们提出了 MErlin(Methylation-driven Expression & Regulation Linkage in Interacting Nuclear-domains,甲基化驱动的相互作用核区室中的表达与调控关联),这是一个多组学工具包,由十七个可组合模块构成,能够将碱基识别后的 modBAM 文件处理为排序后的基因水平证据以及自包含的 HTML 报告。MErlin 同时以传统 Python 软件包和智能体技能的形式发布:后者是一种结构化、版本受控的程序性知识层,使兼容的大语言模型(LLM)助手能够选择并运行经过审查的软件包,而无需针对每项请求重新生成分析实现。该设计将自然语言视为固定分析操作的接口,而不是经过测试的科学软件的替代品。该技能编码了模块选择规则、强制性预检验、人类需要作出判断的问题、从实验设计到统计推断的约束,以及结果解读指南。我们介绍了 MErlin 的架构与统计方法,利用植入真实值的数据集对其进行了验证,并在 Pseudoalteromonas haloplanktis TAC125 的一项真实甲基化组—转录组比较中展示了其对话式接口。MErlin 为开源软件,可通过 https://github.com/IacopoPasseri/MErlin 获取。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.02.748773v1?rss=1

🏷️ 细菌表观基因组学 多组学数据整合 DNA甲基化分析 转录组学 计算生物学工具包