从公共档案到可复用资源:NCBI SRA中肠道微生物组元数据的表征

root 提交于 周三, 09/02/2026 - 18:47
公共测序数据库中包含大量肠道微生物组数据,可用于跨研究比较、可重复性分析以及微生物组基础模型的开发。然而,在数据库存档规模上,这些数据的结构化、协调统一及可复用程度仍不明确。本研究利用 Google BigQuery,对美国国家生物技术信息中心(NCBI)序列读取档案(Sequence Read Archive,SRA)中公开可用的肠道微生物组测序元数据进行了表征,重点关注人类肠道宏基因组、小鼠肠道宏基因组以及广义注释的肠道宏基因组记录。我们评估了数据的时间增长趋势、测序深度、BioSample 与 BioProject 的组织结构、测序平台与仪器的使用情况、元数据完整性、宿主归属、与出版物的关联情况,以及从关联文献中提取的研究主题。公开肠道微生物组数据量随时间显著增加,且主要由人类相关数据集和 Illumina 测序平台构成。核心技术元数据字段的完整性较高,但可复用所需的生物学背景信息,包括宿主身份、表型、研究设计和疾病状态等,往往编码不一致,或需要从 BioSample 属性及关联出版物中进一步恢复。在广义“肠道宏基因组”队列中,仅有 13.00% 的 BioSample 可以确定宿主身份,这凸显了宽泛生物分类注释在自动化队列构建方面的局限性。在数据库存档层面,出版物关联同样不完整,但对于大多数已关联的出版物,仍可恢复可用文本。对与 SRA 关联文献进行的主题建模显示,研究长期持续聚焦于肠道核心微生物群组成,同时人类队列研究和婴幼儿微生物组研究的占比不断增加。总体而言,这些发现表明,公共肠道微生物组数据规模庞大且技术信息丰富,但尚未实现统一的分析就绪状态。若要支持大规模、可靠的数据复用以及面向人工智能的微生物组数据资源建设,仍需改进元数据协调统一、出版物关联以及生物学背景信息恢复等工作。

公共测序数据库中包含大量肠道微生物组数据,可用于跨研究比较、可重复性分析以及微生物组基础模型的开发。然而,在数据库存档规模上,这些数据的结构化、协调统一及可复用程度仍不明确。本研究利用 Google BigQuery,对美国国家生物技术信息中心(NCBI)序列读取档案(Sequence Read Archive,SRA)中公开可用的肠道微生物组测序元数据进行了表征,重点关注人类肠道宏基因组、小鼠肠道宏基因组以及广义注释的肠道宏基因组记录。我们评估了数据的时间增长趋势、测序深度、BioSample 与 BioProject 的结构、测序平台与仪器的使用情况、元数据完整性、宿主归属、出版物关联情况,以及从关联文献中提取的研究主题。公共肠道微生物组数据量随时间显著增长,并且以人类相关数据集和 Illumina 测序平台为主。核心技术元数据字段的完整性较高,但可复用所需的生物学背景信息——包括宿主身份、表型、研究设计和疾病状态——往往编码不一致,或需要从 BioSample 属性及关联出版物中进一步恢复。在通用的“肠道宏基因组”队列中,仅有 13.00% 的 BioSample 可被赋予宿主身份,这凸显了宽泛生物体注释在自动化队列构建中的局限性。在数据库存档层面,出版物关联同样不完整,但对于大多数已关联的出版物,仍可获取可用文本。对与 SRA 关联文献进行的主题建模显示,研究长期以来持续关注肠道核心微生物群组成,同时人类队列研究和婴幼儿微生物组研究所占比例不断增加。总体而言,这些发现表明,公共肠道微生物组数据规模庞大、技术信息丰富,但尚未实现均一的分析就绪状态。若要支持可靠的大规模复用及面向人工智能的微生物组数据资源建设,仍需改进元数据协调统一、出版物关联以及生物学背景信息恢复等工作。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.31.742652v1?rss=1

🏷️ 肠道微生物组 元数据表征 NCBI序列读取档案 数据可复用性 宏基因组学