- 2 次围观
**背景:**过度代表性分析(over-representation analysis,ORA)被广泛用于解释高通量生物学实验获得的基因列表。然而,ORA通常会产生冗长且碎片化的富集术语列表,难以将其转化为连贯且可检验的生物学假设。随着基因集数据库的快速扩展,以及整合多个基因集数据库分析结果的需求不断增加,这一挑战进一步加剧。大型语言模型(large language models,LLMs)能够辅助总结富集分析结果,但由于缺乏可重复性和具有统计学支持的表示形式,其有效性受到限制。 **结果:**我们提出了迭代基因富集分析(iterative Gene Enrichment Analysis,iGEA),这是一种能够将基于ORA的富集分析结果转化为结构化、可解释网络的软件框架,为人工解读和人工智能辅助探索提供支持。iGEA迭代选择最显著的富集术语,从输入基因列表中移除与该术语重叠的基因,并重复进行富集分析,直至不再发现显著术语。在各个基因集数据库中独立应用该流程后,可在每个数据库内获得一组紧凑且彼此不重叠的富集术语。整合各数据库的分析结果后,可构建跨数据库的基因—术语网络,其中基因连接来自不同数据库的术语。应用于一组已发表的HIV依赖因子时,iGEA识别出五个紧凑模块,涵盖分泌性运输、核转运、转录延伸、蛋白质稳态和先天免疫信号传导,从而支持快速生成假设并开展交互式探索。所得网络结构支持标准化提示词构建,并为LLM辅助的富集分析结果总结与探索提供结构化表示。 **结论:**iGEA提供了一种基因富集分析软件框架,通过生成经实证基准评估的紧凑型跨数据库基因—术语网络,解决了ORA结果解释方面的挑战。该网络表示减少了数据库内部的冗余,揭示了不同基因集数据库之间的关联,并提供了一种便于通过可视化、基于网络的分析以及LLM辅助探索识别功能模块和枢纽基因的结构。 **可用性:**源代码可在以下网址获取:https://github.com/aion-labs/Gene-Enrichment-Analysis 该应用程序的网页版可访问:https://iterative-gene-enrichment.streamlit.app
背景:过度代表性分析(over-representation analysis,ORA)被广泛用于解读高通量生物学实验获得的基因列表。然而,ORA通常会产生冗长且碎片化的富集术语列表,难以将其转化为连贯且可检验的生物学假设。基因集集合的快速增长,以及整合多个基因集集合结果的需求,进一步加剧了这一挑战。大语言模型(large language models,LLMs)能够辅助总结富集分析结果,但由于缺乏可重复性和统计学支持的表示形式,其有效性受到限制。
结果:我们提出了迭代式基因富集分析(iterative Gene Enrichment Analysis,iGEA),这是一种能够将基于ORA的富集结果转换为结构化、可解释网络的软件框架,用于支持人工解读和人工智能辅助探索。iGEA迭代选择最显著的富集术语,从输入基因列表中移除与该术语重叠的基因,并重复进行富集分析,直至不再有显著术语为止。在各个基因集集合中独立应用该过程,可在每个集合内获得一组紧凑且彼此不重叠的富集术语。整合各集合的特异性结果后,可构建跨集合的基因–术语网络,其中基因将来自不同集合的术语连接起来。利用一组已发表的HIV依赖因子,iGEA识别出五个紧凑模块,分别涉及分泌运输、核转运、转录延伸、蛋白质稳态和先天免疫信号传导,从而支持快速生成假设和开展交互式探索。所得网络结构支持标准化提示词设计,并为大语言模型辅助的富集结果总结与探索提供了结构化表示。
结论:iGEA提供了一个用于基因富集分析的软件框架,通过生成经实证基准评估的紧凑型跨集合基因–术语网络,解决了ORA结果解读方面的挑战。该网络表示减少了集合内部的冗余,揭示了不同基因集集合之间的关系,并提供了一种结构,使研究者能够通过可视化、基于网络的分析以及大语言模型辅助探索,更容易识别功能模块和枢纽基因。
可用性:源代码可访问:https://github.com/aion-labs/Gene-Enrichment-Analysis 。该应用程序的网页版可访问:https://iterative-gene-enrichment.streamlit.app 。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.06.749570v1?rss=1
🏷️ 基因富集分析 过度代表性分析 基因—术语网络 生物信息学软件 大语言模型辅助分析