- 3 次围观
研究动机:多中心 RNA-seq 研究能够提高统计效能,但隐私法规限制了患者级数据的共享。荟萃分析方法可以规避这一限制,但会损失统计效能,尤其是在各研究中心样本量不平衡的情况下。联邦学习允许各中心仅共享汇总统计量。在三种主流差异表达(DE)分析框架中,Flimma 实现了 limma-voom 的联邦化,而 FedPyDESeq2 实现了 DESeq2 的联邦化。edgeR 仍然更适用于小样本量和高变异性设计,但目前尚无相应的联邦化实现。由于 edgeR 采用迭代重加权最小二乘法(IRLS)和 Cox-Reid 离散度估计,其联邦化难度高于采用单次拟合的 limma-voom。结果:我们提出了 FedEdgeR,这是一种基于安全多方计算(SMPC)保护的联邦化 edgeR 实现,涵盖 IRLS 广义线性模型(GLM)拟合、三级离散度估计以及似然比检验。我们在四个具有代表性的 RNA-seq 数据集上对其进行了评估:两个肿瘤/正常组织队列、一个多队列抗 PD-1 免疫治疗研究,以及一个包含 6 个样本的配对压力测试数据集。在多项指标上,FedEdgeR 均与汇总数据运行的 edgeR 高度一致,例如,−log10 p 值的 Pearson 相关系数 r ≥ 0.99999,排名前 100 位差异表达基因的重叠率达到 100%,并且在名义 FDR 水平 0.05 下 F1 = 1.000。在所有测试数据集上,FedEdgeR 均持续优于 Fisher、Stouffer、随机效应模型和 RankProd 荟萃分析方法。
动机:多中心 RNA-seq 研究能够提高统计效能,但隐私保护法规限制了患者级数据的共享。Meta-analysis 方法可以规避这一限制,但会损失统计效能,尤其是在各研究站点样本量不平衡的情况下。联邦学习允许各站点仅共享汇总统计量。在三种主流差异表达(DE)分析框架中,Flimma 实现了 limma-voom 的联邦化,而 FedPyDESeq2 实现了 DESeq2 的联邦化。edgeR 仍然更适用于小样本和高变异性设计,但目前尚无相应的联邦化实现。与 limma-voom 的单遍拟合相比,edgeR 的迭代加权最小二乘(IRLS)以及 Cox–Reid 离散度估计机制使其更难实现联邦化。
结果:我们提出了 FedEdgeR,这是一种受安全多方计算(SMPC)保护的联邦化 edgeR 实现,涵盖 IRLS 广义线性模型(GLM)拟合、三级离散度估计以及似然比检验。我们在四个具有代表性的 RNA-seq 数据集上对其进行了评估:两个肿瘤/正常组织队列、一个多队列抗 PD-1 免疫治疗研究,以及一个包含 6 个样本的配对压力测试。FedEdgeR 在多项指标上均与集中式 edgeR 相匹配,例如,−log10 p 值的 Pearson 相关系数 r ≥ 0.99999,排名前 100 位差异表达基因的完全重叠率达到 100%,并且在名义 FDR 水平 0.05 下 F1 = 1.000。在所有测试数据集中,FedEdgeR 均持续优于 Fisher、Stouffer、随机效应模型和 RankProd 元分析方法。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.17.752480v1?rss=1
🏷️ 联邦学习 隐私保护 差异基因表达分析 RNA测序 edgeR 安全多方计算