- 6 次围观
过去十年间,随着质谱仪的普及以及技术进步,生成的蛋白质组学数据量呈现出大幅增长的趋势。当前的数据存储与压缩技术在很大程度上将质谱图视为毫无意义的数字序列,不仅在无用噪声上浪费了存储空间,也限制了压缩比。在此,我们提出 SpectroVQ,一种具有噪声感知能力的向量量化自编码器,通过利用深度学习挖掘肽段碎裂模式,在无需任何先验注释的情况下对肽段串联质谱图进行压缩与去噪。评估结果表明,SpectroVQ 能够优先保留来自不同肽离子的质谱图中的有效信号,包括未见过的数据集中的质谱图。与 mzMLb 相比,SpectroVQ 在平均余弦相似度保持在 0.9 以上、肽段鉴定一致率达到 90% 的同时,实现了超过 3 倍的压缩比提升。此外,我们还利用 SpectroVQ 可调节的去噪能力,开发出一种通过常规谱库检索将肽段鉴定数量提高约 15% 的新策略。
过去十年间,随着质谱仪可及性的提高和技术的不断进步,生成的蛋白质组学数据量呈现出 dramatic 增长。现有的数据存储与压缩技术在很大程度上将质谱图视为无意义的数字序列,不仅在无用噪声上浪费了存储空间,也限制了压缩比。在此,我们提出 SpectroVQ,这是一种具备噪声感知能力的向量量化自编码器,可利用深度学习挖掘肽段碎裂模式,在无需任何先验注释的情况下,对肽段串联质谱图进行压缩与去噪。评估结果表明,SpectroVQ 能够优先保留来自不同肽离子的质谱图中的有效信号,包括未见过的数据集中的质谱图。在平均余弦相似度保持在 0.9 以上、肽段鉴定结果一致率达到 90% 的同时,SpectroVQ 相较于 mzMLb 实现了超过 3 倍的压缩比提升。此外,我们还利用 SpectroVQ 可调节的去噪能力,开发了一种通过常规谱库检索将肽段鉴定数提高约 15% 的新策略。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.05.749393v1?rss=1
🏷️ 蛋白质组学 质谱数据压缩 向量量化 深度学习 噪声感知去噪 肽段鉴定
来源出处
SpectroVQ:通过向量量化深度学习实现噪声感知的蛋白质组学数据压缩,提升MS/MS数据存储与肽段鉴定效率
https://www.biorxiv.org/content/10.64898/2026.09.05.749393v1?rss=1