上下文依赖性相关性会误导对批量和单细胞数据中转录组网络的推断

root 提交于 周二, 06/30/2026 - 10:47
背景。相关性是共表达模块发现和 miRNA 靶标推断中的主导性输入。二者都依赖一个隐含假设:在异质性样本(无论是组织、癌症类型还是细胞类型)上汇总得到的 Pearson 相关系数,能够估计某一个具有生物学意义的量。辛普森悖论从原理上使这一假设变得脆弱,因为组间均值偏移可能主导甚至反转组内关联。此类情况在真实转录组数据中出现的频率此前尚未被量化。 结果。在来自 31 个癌症队列的 8,890 个 TCGA 肿瘤样本以及 23,170,038 个 miRNA-mRNA 配对中,94.8% 的配对在队列内同时表现出正相关和负相关。将分析限制在一百万个高方差配对的范围内后发现,在满足 |r_global| >= 0.2 的汇总相关中,有 13.3% 在符号容差 epsilon = 0.05 下,其方向与队列内多数相关方向相反。异质性是常态而非例外(I2 中位数 = 0.86,四分位距 0.80-0.90),且 99.5% 的配对在 FDR

背景。相关性是共表达模块发现和 miRNA 靶标推断的主导性输入。这两者都依赖一个隐含假设:在异质性样本(无论是组织、癌症类型还是细胞类型)中汇总得到的 Pearson 相关系数,估计的是一个具有生物学意义的单一量。辛普森悖论从原理上使这一假设变得脆弱,因为组间均值偏移可能主导甚至反转组内关联。这种情况在真实转录组数据中发生的频率此前尚未被量化。

结果。在来自 31 个癌症队列的 8,890 例 TCGA 肿瘤样本以及 23,170,038 个 miRNA-mRNA 配对中,94.8% 的配对在队列内同时表现出正相关和负相关。将分析限制在 100 万个高方差配对组成的域内后,在满足 |r_global| >= 0.2 且符号容差 epsilon = 0.05 的条件下,13.3% 的汇总相关性相对于队列内多数相关方向发生了反转。异质性是常态而非例外(I2 中位数 = 0.86,四分位距 0.80–0.90),并且在 FDR

结论。单一的汇总相关系数相对于其上下文内组成部分而言,可能以不可忽视的频率发生方向倒置。报告相关性时应同时报告其所处上下文:上下文内分布、异质性统计量,以及用于区分上下文间均值偏移与上下文内关联的诊断指标。我们提供了一个小型 R 接口来计算这些汇总指标。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.06.23.733936v1?rss=1

🏷️ 转录组网络推断 单细胞RNA测序 相关性异质性 辛普森悖论 miRNA-mRNA互作 TCGA