- 4 次围观
来自自身数据集的连锁不平衡(linkage disequilibrium,LD)信息被认为最适合用于统计精细定位等下游分析。然而,对于 \(N\) 个变异,计算复杂度为约 \(N^2/2\) 次运算,因此大多数研究使用外部参考面板,例如来自 1000 Genomes 项目的参考面板。为了在包含数亿个变异的生物样本库规模全基因组测序(whole-genome sequencing,WGS)数据集中捕获所有变异对之间的 LD,亟需新的计算策略。我们提出了一种新方法,利用多 GPU 分布式计算,为数据集中的每一对变异计算 \(R^2\)。在 30× WGS 1000 Genomes 数据集的 22 号染色体上(180 万个变异),我们的方法使用 8 块消费级 12 GB GPU(NVIDIA RTX 2080 Ti)耗时不到 10 分钟;相比之下,使用高端 64 线程 CPU(Intel Xeon Gold 6338)通过 PLINK 完成相同计算耗时超过 80 分钟,对应约 8 倍的加速。我们进一步展示了该方法在真正生物样本库规模数据上的性能:在 Penn Medicine Biobank(PMBB;57,170 个样本)中,计算 1 号染色体 LD(约 138 万个变异)耗时 49 分钟,而 PLINK 需要 22.7 小时,实现了约 28 倍的加速。借助该方法,我们在上述 30× WGS 1000 Genomes 数据集(约 1.2 亿个变异和约 2,500 个样本)上成功计算了完整的 LD 矩阵(超过 \(10^{16}\),即 10 quadrillion 个元素),使用美国能源部阿贡领导力计算设施 Polaris 超级计算机上的 512 块 40 GB NVIDIA A100 GPU,耗时不到 6 小时。我们将这一使用 CuPy 以 Python 编写的工具公开发布。借助该工具,研究人员能够充分利用其基因组数据,而无需依赖外部 LD 参考面板,并获得更准确且具有群体特异性的研究结果,尤其适用于现有数据库中代表性不足的群体。
来自个体自身数据集的连锁不平衡(linkage disequilibrium,LD)信息被认为最适合用于统计精细定位等下游分析。然而,对于包含 \(N\) 个变异的分析,计算复杂度为约 \(N^2/2\) 次运算,因此大多数研究采用外部参考面板,例如千人基因组计划(1000 Genomes)参考面板。为了在包含数亿个变异的生物样本库规模全基因组测序(whole-genome sequencing,WGS)数据集中捕获所有变异对之间的 LD,亟需新的计算策略。我们提出了一种新方法,利用多 GPU 分布式计算,为数据集中的每一对变异计算 \(R^2\)。
在 30× WGS 千人基因组数据集的 22 号染色体上(包含 180 万个变异),我们的方法使用 8 块消费级 12 GB GPU(NVIDIA RTX 2080 Ti)耗时不足 10 分钟;相比之下,使用高端 64 线程 CPU(Intel Xeon Gold 6338)通过 PLINK 完成相同计算耗时超过 80 分钟,相当于实现了约 8 倍的加速。我们进一步在宾夕法尼亚大学医学部生物样本库(Penn Medicine Biobank,PMBB;57,170 个样本)中展示了真正的生物样本库规模性能:计算 1 号染色体的 LD(约 138 万个变异)仅需 49 分钟,而 PLINK 需要 22.7 小时,实现了约 28 倍的加速。
借助该方法,我们在上述 30× WGS 千人基因组数据集(约 1.2 亿个变异和约 2,500 个样本)上成功计算了完整的 LD 矩阵,其中包含超过 \(10^{16}\) 个元素(即超过 10 千万亿个元素);在美国能源部阿贡领导计算设施(Argonne Leadership Computing Facility)的 Polaris 超级计算机上,使用 512 块 40 GB NVIDIA A100 GPU,整个计算过程耗时不到 6 小时。我们将这一采用 Python 和 CuPy 编写的工具公开发布。利用该工具,研究人员无需依赖外部 LD 参考面板,即可充分利用其基因组数据的全部信息,并获得更为准确且具有群体特异性的研究结果,尤其有助于研究现有数据库中代表性不足的人群。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.15.751759v1?rss=1
🏷️ 连锁不平衡 全基因组测序 GPU加速 大规模基因组计算 生物样本库 群体遗传学