- 7 次围观
尽管人类基因组编码了大量调控基因表达的非编码RNA,但由于技术挑战,非编码基因组仍未得到充分研究。具体而言,在转录组测序数据比对过程中,非编码位点与编码位点的重叠会导致读段比对结果产生歧义,进而在后续分析中被弃用。因此,大多数非编码基因组被排除在用于测序比对的标准基因组注释之外。为解决这一问题并实现编码与非编码转录组的同步剖析,我们系统整合了标准编码(GENCODE)与非编码(LncBook)基因组注释,在保留编码基因注释的同时去除了重叠的非编码区域。所得整合基因组注释在保留全部编码基因的同时,将已注释的非编码基因数量从40,785个扩展至138,296个,并减少了歧义读段分配。为评估该整合基因组注释在发现新的、具有生物学相关性的非编码RNA(ncRNA)方面的效用,我们重新比对了MMRF CoMMpass研究中的CD138阳性批量RNA-seq(N = 942)和CD138阴性单细胞RNA-seq(N = 478)数据,构建了一个全面的骨髓瘤骨髓微环境编码-非编码图谱,其中非编码基因占高度可变基因的51%,并表现出显著的细胞类型特异性。基于该整合剖析进行的肿瘤表达谱分析鉴定出15个簇,其中两个簇富集于amp(1q21)或t(4;14),并与更短的无进展生存期(PFS)相关。差异表达分析和系统筛选共得到19个候选高风险ncRNA,其中包括此前未表征的ENSG00000310209,其与较差的PFS(HR = 1.141,P = 0.0025)、IRF4活性增强、Wnt通路激活、CCL5信号传导以及类无能CD8+ T细胞的积累相关。这些发现确立了整合编码-非编码分析作为从转录组测序数据中发现功能性ncRNA的战略性方法。
尽管人类基因组编码了大量调控基因表达的非编码RNA,但由于技术挑战,非编码基因组仍未得到充分研究。具体而言,在转录组测序数据比对过程中,非编码位点与编码位点之间的重叠会产生歧义性的读段比对,而这些读段随后会在下游分析中被丢弃。因此,大多数非编码基因组被排除在用于测序比对的标准基因组注释之外。为应对这一挑战并实现编码与非编码转录组的同步刻画,我们系统整合了标准编码(GENCODE)和非编码(LncBook)基因组注释,保留编码基因注释并移除重叠的非编码区域。所得整合基因组注释在保留全部编码基因的同时,将注释到的非编码基因数量从40,785个扩展至138,296个,并减少了歧义性读段分配。为评估该整合基因组注释在发现新的、具有生物学相关性的非编码RNA(ncRNA)方面的效用,我们重新比对了来自MMRF CoMMpass研究的CD138阳性总体RNA-seq(N = 942)和CD138阴性单细胞RNA-seq(N = 478)数据,构建了骨髓瘤骨髓微环境的综合编码-非编码图谱,其中非编码基因占高变基因的51%,并表现出显著的细胞类型特异性。基于该整合分析进行的肿瘤表达谱分析鉴定出15个簇,其中两个富集于amp(1q21)或t(4;14),并与更短的无进展生存期(PFS)相关。差异表达分析和系统筛选得出了19个候选高风险ncRNA,包括此前未表征的ENSG00000310209,其与较差的PFS(HR = 1.141,P = 0.0025)、IRF4活性增强、Wnt通路激活、CCL5信号传导以及无反应样CD8+ T细胞积累相关。这些发现确立了整合编码-非编码分析作为一种从转录组测序数据中发现功能性ncRNA的策略性方法。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.09.743753v1?rss=1
🏷️ 单细胞转录组 非编码RNA 基因组注释整合 多发性骨髓瘤 临床相关ncRNA