- 3 次围观
背景。已归档转录组数据的再利用支撑着已发表基因组学研究中一个庞大且持续增长的比例。由于上游处理差异会混淆跨研究比较,统一重处理资源库——如 recount3、ARCHS4、DEE2、refine.bio 和 Expression Atlas——被广泛视为补救方案,并且其可获得性在研究设计阶段通常被视为理所当然。然而,对于已发表疾病 RNA-seq 研究总体而言,这种补救方案实际上是否可获得,尚未被测量。既往审计已描述元数据完整性和数据存储率,但尚无研究量化:在已发表研究总体中,有多大比例的研究能够被统一重处理,以及从论文发表到获得可比较计数结果的路径中,这种能力究竟在哪一环节丧失。 结果。我们穷举了 1,124 个 MeSH 疾病描述符,从 Gene Expression Omnibus 中检索到 16,820 个人类 RNA-seq 序列集,并在三个彼此独立、预先注册且由工具强制执行的分析方案下,审计了其中 3,631 个样本量至少为 25 的 bulk、Illumina 平台序列集。在双路径证据标准下,94.1% 的序列集具有公开可得的原始 reads,但仅有 46.7% 出现在任一统一重处理资源库中(界限为 46.7%–57.2%),而在 90% run 阈值下仅有 27.3% 得到可用覆盖(界限为 27.3%–38.8%)。在 3,418 个原始 reads 公开的序列集中,仅 991 个获得可用覆盖,这意味着 71.0% 的 reads 公开序列集未被任何可用资源重处理。资源“存在”高估了其“可用性”:DEE2 出现在 30.2% 的序列集中,但可用的仅占 3.4%。研究设计层面的损耗既独立又严重:24.7% 符合 bulk 原发组织病例对照标准,7.4% 在按样本 accession 计数时进一步达到最小重复阈值,而按不同供体计数时这一比例仅为 4.1%。在供体身份可解析的 199 个序列集中,按供体计算有 4.1% 通过重复标准,而按 accession 计算则为 15.1%,相差 3.73 倍;在整个普查框架中,accession 数量超过不同供体数量 2.65 倍(Manski 界限 1.09–10.77,Imbens-Manski 95% 置信区间 1.07–11.88)。此外,通过常规关键词查询得到的序列集到疾病归属中,有 36.4% 被这些序列集所链接论文自身的人工整理 MeSH 标题所否定。 结论。对于本次审计总体中的大多数已发表人类疾病 RNA-seq 研究而言,统一再分析并不可用,而真正的约束瓶颈在于可用覆盖,而非原始 reads 的存储。能力丧失发生在若干彼此独立的层面,且各层面需要不同的补救措施;其中覆盖层不同于其他层面,是资源维护者可以直接采取行动改善的部分。自动化检索还会高估符合条件的研究数量,既因为其纳入了范围之外的研究设计,也因为其将研究归入了其论文并不支持的疾病类别。
背景。对已归档转录组数据的复用支撑了已发表基因组学中一个庞大且持续增长的部分。由于上游处理差异会混淆跨研究比较,统一重处理资源库——recount3、ARCHS4、DEE2、refine.bio、Expression Atlas——被广泛视为补救方案,并且其可用性在研究设计阶段通常被默认假定。然而,对于已发表疾病 RNA-seq 的总体而言,这种补救方案是否实际上可获得,尚未被测量。既往审计已描述元数据完整性和数据提交率,但尚无研究量化在已发表总体中,有多少比例的研究可以被统一重处理,或这种能力是在从发表到获得可比计数的路径中的哪个环节丧失的。
结果。我们穷尽性枚举了 1,124 个 MeSH 疾病描述符,从 Gene Expression Omnibus 中检索到 16,820 个人类 RNA-seq 序列,并在三个相互独立、预注册且受工具强制执行的分析方案下,对其中 3,631 个样本量至少为 25、采用 Illumina 平台的 bulk RNA-seq 序列进行了审计。按照双路径证据标准,94.1% 的序列可获得公开原始 reads,但仅有 46.7% 出现在任一统一重处理资源库中(界限为 46.7% 至 57.2%),且仅有 27.3% 在 90% run 阈值下获得可用覆盖(界限为 27.3% 至 38.8%)。在 3,418 个原始 reads 公开可得的序列中,仅 991 个获得可用覆盖,这意味着在 reads 公开的序列中,71.0% 未被任何可用的重处理资源覆盖。存在性高估了可用性:DEE2 出现在 30.2% 的序列中,但可用的仅占 3.4%。研究设计造成的流失是独立且严重的:24.7% 符合 bulk 原发组织病例对照标准;按样本 accession 计数时,另有 7.4% 进一步达到最小重复阈值;按不同供体计数时,仅有 4.1% 达到该阈值。在供体身份可解析的 199 个序列中,按供体计数仅 4.1% 通过重复标准,而按 accession 计数则为 15.1%,相差 3.73 倍;在整个普查框架中,accession 数超过不同供体数 2.65 倍(Manski 界限 1.09 至 10.77,Imbens-Manski 95% 置信区间 1.07 至 11.88)。此外,由常规关键词查询产生的序列到疾病归属中,有 36.4% 被这些序列所链接论文自身的人工整理 MeSH 主题词所否定。
结论。在所审计的总体中,已发表人类疾病 RNA-seq 的统一再分析对大多数研究而言是不可获得的,而关键约束是可用覆盖,而非原始 reads 的提交。能力损失发生在多个彼此独立的层面,且各自需要不同的补救措施;其中,覆盖层不同于其他层面,是资源维护者可以直接采取行动加以改进的环节。自动化检索还会高估符合条件的研究数量,其原因既包括纳入了范围之外的研究设计,也包括将研究归入其论文并不支持的疾病。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.05.742891v1?rss=1
🏷️ RNA测序 数据重分析 GEO数据库 转录组学 数据可复现性