条形码推断流程(BIP):从测序仪输出到 DNA 条形码

root 提交于 周六, 07/25/2026 - 20:47
DNA条形码鉴定涉及从来源标本中获取目标基因区域的DNA序列。当从单个标本中回收出多个序列时,这一过程会变得更加复杂;而在采用高通量测序仪生成数据时,这种情况十分常见。这种序列多样性既可能反映方法学伪影(如嵌合体、PCR错误、测序错误、标签跳跃),也可能反映DNA提取物中真实的模板多样性(如污染、内共生体、NUMTs、寄生生物)。为支持每年对300万个标本的序列数据进行分析,生物多样性基因组中心(Centre for Biodiversity Genomics, CBG)开发了BIP,即条形码推断流程(Barcode Inference Pipeline)。BIP兼容所有测序平台,可处理.fastq文件,并返回目标DNA条形码和非目标序列。为生成分析结果,BIP实施了质量和长度过滤、去混样、引物修剪、嵌合体扫描、序列错误校正、OTU界定以及序列鉴定。当分析目标为细胞色素c氧化酶亚基1(cytochrome c oxidase 1, COI)条形码区域时,BIP还会将每个OTU分配到已知的BIN,或识别其最近邻BIN。作为最终输出,BIP返回可直接上传至BOLD或用于其他下游分析的汇总文件。这些文件包括通过与DNA条形码参考文库比对而生成的每个OTU的分类学注释。我们描述了BIP的灵活性和结构,随后通过分析来自10万个标本的COI序列数据展示其功能。由于具备区分目标序列与非目标序列的能力,BIP在若干重要方面优于另一软件包ONTbarcoder。为便于获取、安装和使用,BIP以Docker容器形式提供(github.com/cbg-innov/BIP)。

DNA条形码技术涉及从其来源标本中恢复目标基因区域的DNA序列。当从单个标本中恢复出多条序列时,这一过程会变得更加复杂;而在采用高通量测序仪生成数据时,这种情况通常较为常见。这种序列多样性既可能反映方法学伪影(例如嵌合体、PCR错误、测序错误、标签跳跃),也可能反映DNA提取物中模板的真实多样性(例如污染、内共生体、NUMTs、寄生物)。为支持每年对300万个标本的序列数据进行分析,生物多样性基因组中心(Centre for Biodiversity Genomics, CBG)开发了BIP,即条形码推断流程(Barcode Inference Pipeline)。BIP兼容所有测序平台,可处理.fastq文件,并返回目标DNA条形码及非目标序列。为生成分析结果,BIP执行质量与长度过滤、样本拆分、引物剪切、嵌合体扫描、序列错误校正、OTU划分以及序列鉴定。当分析目标为细胞色素c氧化酶亚基1(cytochrome c oxidase 1, COI)条形码区域时,BIP还会将每个OTU分配至一个已知BIN,或识别其最近邻BIN。作为最终输出,BIP返回可直接上传至BOLD或用于其他下游分析的汇总文件。其中包括通过与DNA条形码参考文库比对而生成的每个OTU的分类学注释。我们描述了BIP的灵活性和结构,随后通过分析来自10万个标本的COI序列数据展示其功能。由于具备区分目标序列与非目标序列的能力,BIP在若干重要方面优于另一款软件包ONTbarcoder。为便于获取、安装和使用,BIP以Docker容器形式提供(github.com/cbg-innov/BIP)。

作者声明不存在竞争性利益。

注意:要求提供您的电子邮箱地址,仅用于将您识别为本文的发送者。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.21.739876v1?rss=1

🏷️ DNA条形码 高通量测序 生物信息学流程 COI基因 OTU界定 序列鉴定