用于组学合成的对抗性随机森林

root 提交于 周三, 09/16/2026 - 20:47
数据可用性对于理解复杂疾病通路和构建稳健的预测模型至关重要。尽管高通量组学技术提高了人们对疾病机制的认识,但从中枢神经系统等难以获取的组织中采集数据仍然是一项主要限制,导致样本量较小,并增加了阿尔茨海默病和帕金森病等神经退行性疾病早期预测的难度。生成式建模已成为一种强大的数据合成方法,可在小样本条件下支持后续的聚类与预测,但现有方法很少能够有效处理高维表格型组学数据。对抗性随机森林(adversarial random forests,ARFs)为表格数据生成提供了性能良好的框架,但其设计并不适用于高维场景。为解决这一局限性,我们提出了高维对抗性随机森林(high-dimensional ARF,h-ARF),这是ARF的一种扩展,针对临床数据与高维组学数据的整合进行了优化。通过在九个数据集和八项性能指标上的基准测试,我们表明,与ARF相比,h-ARF能够更好地保留特征分布以及下游聚类和预测效用。该方法已在开源R软件包harf中实现,并可通过CRAN获取。

数据可得性对于理解复杂疾病通路和开发稳健的预测模型至关重要。尽管高通量组学技术提升了我们对疾病机制的认识,但从中枢神经系统等难以获取的组织中采集数据仍是一项主要限制,导致样本量较小,并增加了阿尔茨海默病和帕金森病等神经退行性疾病早期预测的难度。生成式建模已成为一种强有力的方法,可在小样本条件下合成数据,以支持下游聚类和预测;然而,现有方法很少能够有效处理高维表格型组学数据。对抗随机森林(adversarial random forests,ARFs)为表格型数据生成提供了性能良好的框架,但其并非针对高维场景而设计。为解决这一局限性,我们提出了高维对抗随机森林(high-dimensional ARF,h-ARF),这是ARF的一种扩展,针对临床数据与高维组学数据的整合进行了优化。通过在九个数据集和八项性能指标上的基准测试,我们表明,与ARF相比,h-ARF能够更好地保持特征分布,以及下游聚类和预测的效用。该方法已在开源R软件包harf中实现,并可从CRAN获取。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.09.750490v1?rss=1

🏷️ 高维组学数据 生成式建模 对抗性随机森林 数据合成 疾病预测