Isocall:实现从长读长 RNA 测序数据中进行可扩展的转录本鉴定

root 提交于 周一, 09/14/2026 - 22:47
长读长RNA测序能够直接解析RNA转录本的完整结构。随着测序通量的提升,如今可以对数百个样本组成的队列进行深度测序,从而实现跨大规模数据集的联合转录本发现。然而,现有的转录本鉴定方法最初是针对小规模数据集设计的,限制了其在这一规模下的适用性。在此,我们提出Isocall,这是一种可扩展且具有确定性的计算方法,用于从多个PacBio长读长RNA测序样本中联合识别转录本。Isocall将比对后的全长非串联重复读段转换为每个样本的紧凑型转录本谱,在样本间合并这些转录本谱,并基于分析数据集中读段的支持联合鉴定已知和新型转录本。过滤过程具有可调性:预设选项可提供粗粒度控制,而相对丰度和内部引物起始阈值等单独参数则可实现细粒度控制。在准确性基准测试中,包括WTC11 SIRV加标对照,Isocall均表现出较高的精确率;在默认设置下,对于三种SIRV混合物,Isocall每个样本报告的假阳性转录本数为0–2个。为验证其可扩展性,我们将Isocall应用于来自人类泛基因组参考联盟的206个样本,共计35亿条原始读段。在完成并行化pbmm2比对和Isocall profile步骤后,call步骤在整个数据集上进行联合识别,仅耗时25分钟,峰值内存使用量为1.3 GB,并使用8个线程。最后,在具有匹配SNP基因型的Genome in a Bottle样本中,剪接位点多态性为评估识别准确性提供了额外指标:Isocall恢复了337个多态性剪接位点,其中包括BTN3A1中的一个从头供体位点;该位点与突变等位基因上的完整异构体转换相对应。

长读长 RNA 测序能够直接解析 RNA 转录本的完整结构。测序通量的提升如今已支持对数百个样本组成的大规模队列进行深度测序,从而使跨大型数据集联合发现转录本成为可能。然而,现有的转录本鉴定方法是针对小规模数据集设计的,这限制了其在这一规模下的适用性。在此,我们提出 Isocall,这是一种可扩展且具有确定性的计算方法,用于从多个 PacBio 长读长 RNA 测序样本中联合识别转录本。Isocall 将比对后的全长非串联体读段转换为紧凑的逐样本转录本谱,在多个样本间合并这些谱,并根据所分析数据集中读段的支持情况联合鉴定已知和新型转录本。过滤过程具有可调性:预设参数可提供粗粒度控制,而包括相对丰度阈值和内部引物启动阈值在内的单项参数则可提供细粒度控制。在准确性基准测试中,Isocall 展现出较高的精确率;在 WTC11 SIRV 加标对照实验中,采用默认设置时,针对三种 SIRV 混合物,Isocall 每个样本报告的假阳性转录本数为 0–2 个。为展示其可扩展性,我们将 Isocall 应用于人类泛基因组参考联盟的 206 个样本,共计 35 亿条原始读段。在采用并行化 pbmm2 完成比对及 Isocall 谱构建后,调用步骤仅用时 25 分钟,即完成整个数据集的联合识别;该过程使用 8 个线程,峰值内存占用为 1.3 GB。最后,在具有匹配 SNP 基因型的 Genome in a Bottle 样本中,剪接位点多态性为评估识别准确性提供了额外指标:Isocall 找回了 337 个多态性剪接位点,其中包括 BTN3A1 中的一个从头供体位点;该位点在突变等位基因上对应于完整的异构体转换。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.08.749180v1?rss=1

🏷️ 长读长RNA测序 转录本鉴定 异构体分析 PacBio测序 转录组学 生物信息学算法