lisaR:一种由大语言模型推断的用于基因集富集分析的生物学类别语义注释

由 root 提交于 周三, 10/07/2026 - 08:47
基因集富集分析(gene set enrichment analysis,GSEA)将差异表达结果转化为富集基因集列表。这些列表通常较长且存在冗余,并涉及多个基因集集合,从而增加了生物学解释的难度。我们介绍了 lisaR,这是一个能够读取此前计算得到的差异表达或差异丰度结果、运行 GSEA,并利用 LISA 词典(LLM-Inferred Semantic Annotation,基于大语言模型推断的语义注释)对输出结果进行整理的 R 软件包。LISA 词典将来自三个 Gene Ontology 分支以及 Reactome、WikiPathways、KEGG、BioCarta 和 PID 等经整理的通路集合中的 13,511 个基因集,归入四个词典中的 42 个超类别下的 158 个生物学类别。四个开放权重语言模型对每个基因集与各类别之间的语义匹配度进行评分,并通过共识规则确定其归属。词典随软件包一同发布,且不依赖于具体数据:使用相同词典在不同时间分析的研究将采用相同的类别进行解释,并且分析过程中无需调用语言模型。 对于每个类别,lisaR 总结其中显著基因集的富集方向,并采用基于 Hommel 稳健程序的闭合检验,判断该类别是否具有富集证据,同时给出其中富集基因集数量的同时下界。lisaR 的结果汇总于可在网页浏览器中打开的报告中,用户可从每个类别逐级查看其基因集及基因;每幅图均与其数据和 R 代码一并保存。我们以两项研究展示该工作流程:一项是对纳武利尤单抗治疗前及治疗期间采集的黑色素瘤活检样本进行 RNA-seq 分析,另一项是对透明细胞肾细胞癌的配对肿瘤组织与邻近组织进行蛋白质组学分析。获取方式:lisaR 可从 https://github.com/DBM-OlmedaLab/lisaR 获取,并存档于 https://doi.org/10.5281/zenodo.23044930;相关文档见 https://olmedalab.org/lisaR/。

基因集富集分析(gene set enrichment analysis,GSEA)将差异表达结果转化为富集基因集列表。这些列表通常较长且存在冗余,并且涵盖多个基因集集合,从而使其生物学解释变得困难。我们提出了 lisaR,这是一款能够读取预先计算的差异表达或差异丰度结果、运行 GSEA,并利用 LISA 词典(LLM-Inferred Semantic Annotation,基于大语言模型推断的语义注释)对输出结果进行组织的 R 软件包。LISA 词典将来自三个 Gene Ontology 分支以及 Reactome、WikiPathways、KEGG、BioCarta 和 PID 等人工整理的通路集合中的 13,511 个基因集,归入四套词典中的 158 个生物学类别,并进一步组织为 42 个超类别。四个开放权重语言模型对每个基因集与各类别之间的语义匹配程度进行评分,并通过共识规则确定其类别归属。词典随软件包一同发布,且不依赖具体数据:使用同一词典在不同时间分析的研究将采用相同的类别进行解释,并且分析过程中无需调用语言模型。对于每个类别,lisaR 总结其显著基因集的富集方向,并采用基于 Hommel 稳健程序的闭合检验,判断该类别是否存在富集证据,同时给出其基因集中富集基因集数量的同时下界。lisaR 将结果汇总为一份可在网页浏览器中打开的报告,用户可从每个类别逐级查看其基因集及基因;每幅图均与相应的数据和 R 代码一并保存。我们以两项研究展示该工作流程:一项为黑色素瘤活检样本在纳武利尤单抗治疗前及治疗期间进行的 RNA 测序研究,另一项为透明细胞肾细胞癌中配对肿瘤组织与邻近组织的蛋白质组学研究。获取方式:lisaR 可通过 https://github.com/DBM-OlmedaLab/lisaR 获取,并已存档于 https://doi.org/10.5281/zenodo.23044930;相关文档见 https://olmedalab.org/lisaR/。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.29.755425v1?rss=1

🏷️ 基因集富集分析 大语言模型 语义注释 基因本体与通路分析 差异表达分析 R软件包