- 4 次围观
5'非翻译区(5'UTR)塑造了翻译起始过程,因此其设计对于mRNA治疗以及改进蛋白质生产细胞系至关重要。基于深度学习的模型可根据5'UTR序列预测以平均核糖体负载(mean ribosome load, MRL)衡量的翻译效率,并已与遗传算法(genetic algorithms, GAs)结合用于序列优化。然而,针对离线数据训练得到的模型进行优化,存在奖励劫持的风险,即利用模型在训练分布之外的估计误差,产生在预测中得分很高、却无法在湿实验中表现良好的序列。然而,对于5'UTR设计,迄今鲜有研究系统考察应将哪些区域视为不可信区域(即分布外,out-of-distribution, OOD)的定义,或应采用哪些约束使搜索远离这些区域。我们提出了一种受约束优化方法,使候选序列保持在一个可信区域内,在该区域中预测器经过验证的准确性能够成立;此处“可靠”是指将候选序列限制在已验证预测性能的训练分布之内,而不意味着对实测性能作出保证。作为OOD评分,我们比较了预测器嵌入空间中的k近邻(k-nearest-neighbor, KNN)距离与由编码器和语言模型头(LM head)计算得到的伪困惑度(pseudo-perplexity, PPPL),并表明对于词汇表较小的核苷酸序列而言,PPPL无法区分分布内与分布外样本,而KNN距离是一种有效的OOD评分,甚至可以仅基于无标签的天然UTR序列来定义可信区域。将KNN距离用作遗传算法中的硬约束,可以在保持预测MRL的同时,使所有候选序列都留在可信区域内:在无约束优化下,大多数末代候选序列(不同随机种子下为72–96%)离开了可信区域(self-KNN p95),而硬约束则将预测MRL维持在无约束水平,并且相比对无约束输出进行事后筛选,可产生约4.3倍更多可选的低风险候选序列。通过比较输出外推保护、参考序列相似性以及结构可及性(RNAplfold),我们发现保护机制和相似性约束也会作为副作用抑制OOD,而将可及性设为次级优化目标则会扩大搜索范围,但不会抑制OOD。
5'非翻译区(5'UTR)决定翻译起始过程,因此其设计对于mRNA治疗以及提高蛋白质生产细胞系至关重要。基于深度学习的模型已被用于根据5'UTR序列预测以平均核糖体负载(mean ribosome load, MRL)衡量的翻译效率,并与遗传算法(genetic algorithms, GAs)结合以进行序列优化。然而,针对离线数据训练得到的模型进行优化,存在奖励劫持的风险,即利用模型在训练分布之外的估计误差,产生在预测中得分很高、却无法在湿实验中实现预期性能的序列。然而,在5'UTR设计中,鲜有研究系统性地考察应将哪些区域视为不可信区域(即分布外,out-of-distribution, OOD)的定义),或哪些约束能够使搜索过程避开这些区域。我们提出了一种受约束优化方法,将候选序列限制在一个信任区域内,在该区域中预测器经过验证的准确性能够成立;这里“可靠”是指将候选序列保持在已验证预测有效性的训练分布之内,而并不保证其实测性能。作为OOD评分,我们比较了预测器嵌入空间中的k近邻(k-nearest-neighbor, KNN)距离与来自编码器和语言模型头(LM head)的伪困惑度(pseudo-perplexity, PPPL),并表明对于词汇表较小的核苷酸序列,PPPL无法区分分布内与分布外样本,而KNN距离是一种有效的OOD评分,甚至可以仅基于无标签的天然UTR序列来定义信任区域。将KNN距离作为遗传算法中的硬约束,可以在维持预测MRL的同时,使所有候选序列始终位于信任区域内:在无约束优化下,大多数最终代候选序列(不同随机种子下为72–96%)离开了信任区域(self-KNN p95);而硬约束能够将预测MRL保持在无约束水平,并且相比于对无约束输出进行事后筛选,可产生约4.3倍更多可供选择的低风险候选序列。通过比较输出外推防护、参考序列相似性以及结构可及性(RNAplfold),我们发现,外推防护和相似性约束也会作为副作用抑制OOD,而将可及性作为次级优化目标则会拓宽搜索范围,却不能抑制OOD。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.03.742388v1?rss=1
🏷️ 5'UTR设计 机器学习优化 分布外检测 遗传算法 翻译效率预测 mRNA治疗