- 8 次围观
动机:测序成本的持续下降推动了可获得测序数据量的指数级增长,欧洲核苷酸序列档案库(European Nucleotide Archive,ENA)和序列读取档案库(Sequence Read Archive,SRA)等公共数据库的数据规模已达到数拍碱基(petabase)量级。这促使研究人员开发更具可扩展性的常见生物信息学任务工具。其中一项任务是在参考数据集中近似搜索基因或测序读段等短序列模式。近年来,研究人员提出了多种用于检索大型测序数据库的索引数据结构。当前最先进的索引结构——分层交错布隆过滤器(Hierarchical Interleaved Bloom Filter,HIBF)率先实现了对一百万个样本的索引。若要用于不断扩展的数据库,必须进一步扩展其功能,以支持动态更新。 结果:本文通过引入部分重建机制扩展HIBF,从而支持高效更新,提出了一种具有可扩展性且可更新的序列搜索索引。我们通过迭代构建索引,展示了动态HIBF处理大规模数据的能力:该索引涵盖了超过39,000个完整的人类RNA-Seq样本,总计超过100 TB的压缩测序读段,并以每批100个样本的连续批次进行更新。为与当前最先进的工具进行基准比较,我们在一个包含5,000个样本的子集上评估了增量式性能;这些样本的原始测序深度均被下采样至1%。在这一比较环境下,动态HIBF在5小时内完成了全部5,000个样本的顺序插入,其速度比竞争方法快24至65倍,并且比静态HIBF快两倍。
研究动机:测序成本的持续下降推动了可获得测序数据量的指数级增长,欧洲核苷酸档案库(European Nucleotide Archive,ENA)和序列读取档案库(Sequence Read Archive,SRA)等公共数据库中的数据规模已达到数拍字节量级。这促使研究人员开发出更具可扩展性的常用生物信息学工具。其中一项任务是在参考数据集中近似搜索基因或测序读段等短序列模式。近年来,研究人员提出了多种用于搜索大型测序数据库的索引数据结构。当前最先进的索引——分层交错布隆过滤器(Hierarchical Interleaved Bloom Filter,HIBF)率先实现了对一百万个样本建立索引。为了适用于不断扩展的数据仓库,必须对其进行扩展以支持动态更新。
研究结果:本文通过引入部分重建机制对 HIBF 进行扩展,以支持高效更新,从而提出了一种具有可扩展性且可更新的序列搜索索引。我们通过迭代构建索引,展示了动态 HIBF 处理大规模数据的能力:该索引涵盖了超过 39,000 个完整的人类 RNA-Seq 样本,总计超过 100 TB 的压缩测序读段,并以每批 100 个样本的连续批次进行更新。为与当前最先进的工具进行基准比较,我们在一个包含 5,000 个样本的子集上评估了增量性能;这些样本的测序深度均被下采样至其原始测序深度的 1%。在这一比较环境下,动态 HIBF 在 5 小时内完成了全部 5,000 个样本的顺序插入,其速度比竞争方法快 24 至 65 倍,并且是静态 HIBF 的两倍。
感谢您有兴趣传播 bioRxiv 的相关信息。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.26.747224v1?rss=1
🏷️ 布隆过滤器 动态索引 序列搜索 大规模测序数据 生物信息学算法