- 2 次围观
宏基因组学中的准确分类常受到低复杂度序列的影响,因为这类序列容易产生偶然匹配,进而导致序列被错误分类。本文介绍了 Kmask,这是一种基于熵的掩蔽工具,既可独立使用,也可作为 Kraken [1,2] 数据库构建流程的一部分;该工具通过将低熵区域替换为 N 来实现掩蔽。Kmask 采用与 Kraken 默认 k-mer 长度相匹配的滑动窗口大小,并基于覆盖广泛 GC 含量范围的 12 个对照细菌基因组优化参数,从而能够在保留高复杂度区域的同时高效去除低复杂度序列。为评估其性能,我们将 Kmask 应用于新构建的 Microbial2025 数据库,该数据库包含超过 71,000 个细菌、古菌、病毒和真菌基因组;随后,我们使用 KrakenUniq [2],分别基于该数据库的掩蔽版本和未掩蔽版本对人类测序读段进行分类。结果表明,Kmask 显著减少了错误分类,使假阳性率从 7.52% 降至 5.78%。值得注意的是,Kmask 的表现与经过 SDUST [3] 掩蔽的数据库相当,其假阳性率相近(5.78% 对 5.17%),但所掩蔽的碱基更少(1.33% 对 1.85%)。我们还在一个人类癌症序列数据库上测试了 Kmask,发现该工具消除了许多由细菌基因组与人类 DNA 之间的低复杂度匹配所导致的假阳性。这些结果表明,Kmask 是一种在大型微生物数据库中掩蔽低复杂度序列的有效方法,有助于提高宏基因组分类的准确性。
使用 Kmask 改进宏基因组分类:基于熵的低复杂度区域屏蔽 | bioRxiv
跳转至主要内容 主页 关于 投稿 警报 / RSS 搜索此关键词 高级搜索 最新结果
使用 Kmask 改进宏基因组分类:基于熵的低复杂度区域屏蔽
查看 ORCID 个人资料 Yuchen Ge , Edward Li , 查看 ORCID 个人资料 Harun Mustafa , 查看 ORCID 个人资料 Ales Varabyou , 查看 ORCID 个人资料 Steven L Salzberg
doi: https://doi.org/10.64898/2026.09.22.753623
Yuchen Ge 1 约翰斯·霍普金斯医学院; 在 Google Scholar 中查找该作者 在 PubMed 中查找该作者 在持有人为作者 / 资助方,其已授予 bioRxiv 永久展示该论文的许可。
该论文依据 CC-BY 4.0 国际许可协议提供。
返回顶部 上一篇 下一篇
发布于 2026 年 9 月 23 日。
下载 PDF 补充材料 数据 / 代码 电子邮件
感谢您有意传播 bioRxiv 上的内容。
您的电子邮件 *
您的姓名 *
发送至 *
请输入多个地址,每行一个,或使用逗号分隔。
您将要发送以下内容:
使用 Kmask 改进宏基因组分类:基于熵的低复杂度区域屏蔽
邮件主题:(您的姓名)从 bioRxiv 网站转发了一篇页面给您
邮件正文:(您的姓名)认为您可能会对 bioRxiv 网站上的此页面感兴趣。
您的个人留言
验证码
此问题用于测试您是否为真实用户,并防止自动垃圾邮件提交。
分享
使用 Kmask 改进宏基因组分类:基于熵的低复杂度区域屏蔽
Yuchen Ge , Edward Li , Harun Mustafa , Ales Varabyou , Steven L Salzberg
bioRxiv 2026.09.22.753623; doi: https://doi.org/10.64898/2026.09.22.753623
分享本文:
复制
引用工具
使用 Kmask 改进宏基因组分类:基于熵的低复杂度区域屏蔽
Yuchen Ge , Edward Li , Harun Mustafa , Ales Varabyou , Steven L Salzberg
bioRxiv 2026.09.22.753623; doi: https://doi.org/10.64898/2026.09.22.753623
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.22.753623v1?rss=1
🏷️ 宏基因组分类 低复杂度序列 熵掩蔽 k-mer分析 假阳性控制