解码翻译起始的序列要求

由 root 提交于 周四, 10/08/2026 - 06:47

内容形式:摘要译文

核糖体对起始密码子的准确选择是决定蛋白质组组成的基本因素。尽管“科扎克序列”(Kozak sequence)——一种位于起始密码子两侧、由8个核苷酸组成的序列——长期以来一直被视为真核生物翻译起始的主要决定因素,但它无法解释不同转录本之间起始密码子使用的高度多样性。在本研究中,我们结合大规模平行报告基因检测、生物信息学、机器学习、单分子成像和冷冻电子显微镜技术,定义了“扩展翻译起始序列”(extended translation initiation sequence,eTIS)。该序列是围绕起始密码子、长度约为80个核苷酸的序列,能够调控翻译起始效率。基于eTIS特征训练的深度学习模型能够准确预测不同转录本中的翻译起始。出乎意料的是,我们发现,正如人们普遍认为的那样,科扎克序列并非翻译起始的最优序列,并进一步确定了造成这一差异的原因。促进高效翻译起始的eTIS核苷酸在人类转录组中富集,并且在进化过程中受到保守,这凸显了其功能重要性。生物物理学和结构分析表明,特定的eTIS残基——包括关键的+6位点以及位于mRNA进入通道和退出通道中的残基——能够与核糖体蛋白质、核糖体RNA和起始因子发生相互作用,通过稳定起始密码子处的核糖体并促进翻译起始所需的结构转变,推动核糖体对起始密码子的识别。最后,对eTIS进行优化可显著提高治疗性mRNA的翻译保真度和蛋白质产量,凸显了其实际应用价值。综上,这些发现重新定义了翻译起始的序列逻辑,并为精确调控蛋白质表达建立了一个框架。

关键词:翻译起始 · 扩展翻译起始序列 · 科扎克序列 · 核糖体 · 深度学习 · 翻译调控

原文链接:https://www.biorxiv.org/content/10.64898/2026.05.12.723742v1?rss=1