用于个体基因组序列到表达预测的基于去卷积推导的细胞类型表达目标

root 提交于 周六, 07/25/2026 - 12:47
序列到功能模型能够从基因组序列中学习调控特征,但其在预测个体间基因表达差异方面的能力仍然有限。细胞类型特异性的调控效应可能在整体RNA测序中被掩盖,而同时具有配对基因型和单细胞表达数据的队列规模仍然较小。我们评估了对整体RNA-seq进行去卷积是否能够为个体基因组表达预测提供可扩展的细胞类型特异性目标。 我们使用BayesPrism结合单核参考表达谱,对来自六种组织的GTEx v8整体RNA-seq数据进行了去卷积,从而在83种组织—细胞类型情境中生成目标。去卷积表达与匹配的GTEx单核RNA-seq伪整体化数据一致;按组织划分,跨基因的供体水平Pearson相关系数中位数范围为0.53至0.73。 我们比较了基因型特征模型、基于冻结Enformer表征训练的回归模型,以及经过微调的Enformer和Borzoi模型。在随机基因集和非线性富集基因集中,基于序列的方法总体上优于基因型特征基线,而冻结的Enformer特征与端到端微调相比也具有竞争力。对于随机基因集,在考虑覆盖度的敏感性分析中,基于序列的方法的Fisher平均Pearson相关系数为0.122—0.142,而基因型特征基线为0.081—0.086。 对于基于序列的模型,模型性能与去卷积—伪整体化一致性呈正相关(跨组织—细胞类型情境,$r=0.35$—$0.43$),这表明目标的可靠性可能限制下游预测。情境特异性的Enformer微调并未显著优于共享的联合情境策略。这些结果表明,去卷积是生成细胞类型分辨训练目标的一种可行方法,但目标质量和有限的队列规模仍然是重要约束。冻结的预训练表征为个体序列到表达建模提供了一种计算高效且具有竞争力的基线。

序列到功能模型能够从基因组序列中学习调控特征,但其在预测个体间基因表达差异方面的能力仍然有限。细胞类型特异性的调控效应可能在整体RNA测序中被掩盖,而同时具备基因型和单细胞表达数据的配对队列规模仍然较小。我们评估了对整体RNA-seq进行解卷积,是否能够为个体基因组表达预测提供可扩展的细胞类型特异性靶标。利用单核参考表达谱,采用BayesPrism对来自六种组织的GTEx v8整体RNA-seq数据进行解卷积,在83种组织—细胞类型背景中生成了靶标。解卷积表达与匹配的GTEx单核RNA-seq伪整体化表达结果一致,在不同组织中,基于供体水平、跨基因的Pearson相关系数中位数范围为0.53至0.73。我们比较了基因型特征模型、基于冻结的Enformer表征训练的回归模型,以及经过微调的Enformer和Borzoi模型。在随机基因集和富含非线性效应的基因集中,基于序列的方法总体上优于基因型特征基线,而冻结的Enformer特征与端到端微调相比也具有竞争力。对于随机基因集,在考虑覆盖度的敏感性分析中,基于Fisher平均的Pearson相关系数为:序列衍生方法0.122—0.142,基因型特征基线0.081—0.086。对于基于序列的模型,模型性能与解卷积—伪整体化一致性呈正相关(跨组织—细胞类型背景,$r=0.35$—$0.43$),这表明靶标可靠性可能限制下游预测表现。针对特定背景的Enformer微调并未显著优于共享的多背景联合策略。这些结果支持将解卷积作为生成细胞类型分辨训练靶标的一种可行方法,同时也表明靶标质量和有限的队列规模仍然是重要限制因素。冻结的预训练表征为个体化序列到表达建模提供了一种计算高效且具有竞争力的基线方案。

作者声明不存在竞争性利益。

感谢您有意帮助传播bioRxiv上的研究成果。

注意:要求提供您的电子邮箱地址,仅用于将您识别为本文的发送者。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.20.739672v1?rss=1

🏷️ 基因表达预测 RNA-seq去卷积 细胞类型特异性表达 序列到功能模型 单细胞转录组 Enformer