基于 Copula 的合成长纵向表格数据生成

root 提交于 周六, 08/08/2026 - 12:47
合成数据生成正日益被用于在保护参与者隐私的同时实现数据共享和二次分析,尤其适用于纵向表格型健康数据。在这类数据中,每位受试者的重复测量会产生受试者内依赖性,而大多数合成数据方法并非旨在保留这种依赖结构。现有生成方法,特别是基于生成对抗网络(GAN)的方法,能够建模复杂分布,但其所估计的依赖结构通常难以解释,且在中等规模数据集中其性能可能不稳定或易于过拟合。本文表明,eCDF-copula 作为一种具有统计学基础的方法,利用经验累积分布函数(eCDF)和 copula 建模,能够保留访视内和访视间的依赖结构。为处理普遍存在的缺失数据,我们提出了一种两阶段策略,将多重插补与基于 copula 的合成相结合,从而实现方差分解,以量化不同方法之间的重复变异性。我们在两个纵向临床数据集上将所提出的方法与四种既有方法进行了基准比较,这两个数据集的样本量差异显著(n=120 vs. n=3,612)。eCDF-copula 在保持可比隐私性的同时,其相似性和效用均优于当前最先进的合成数据方法。

合成数据生成正越来越多地被用于在保护参与者隐私的同时实现数据共享和二次分析,尤其适用于纵向表格型健康数据;在这类数据中,每位受试者的重复测量会产生受试者内依赖性,而大多数合成数据方法并非为保留这种依赖性而设计。现有生成方法,特别是基于生成对抗网络(GAN)的方法,能够刻画复杂分布,但其估计得到的依赖结构往往难以解释,且在样本量适中的数据集中,其性能可能不稳定或容易过拟合。本文表明,eCDF-copula 这一具有统计学基础的方法,通过结合经验累积分布函数(eCDF)与 copula 建模,能够保留访视内和访视间的依赖结构。为处理普遍存在的缺失数据,我们提出了一种两阶段策略,将多重插补与基于 copula 的合成相结合,从而实现方差分解,以量化不同方法之间的重复变异性。我们在两个纵向临床数据集上将所提方法与四种已有成熟方法进行了基准比较,这两个数据集的样本量差异显著(n=120 对比 n=3,612)。结果表明,eCDF-copula 在保持相当隐私水平的同时,其相似性和实用性均优于当前最先进的合成数据方法。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.03.742474v1?rss=1

🏷️ 合成数据生成 纵向表格数据 Copula建模 隐私保护 多重插补