RIFT-VAE:用于RNA逆向折叠的语法条件预训练与潜在空间优化

root 提交于 周二, 08/18/2026 - 22:47
背景:RNA逆折叠旨在设计预期能够采用给定二级结构的核苷酸序列。基于搜索的求解器能够有效优化折叠模型目标,但对于困难靶标,往往需要大量采样,而且仅进行结构优化并不能显式保持天然RNA家族的序列分布或保守基序。 方法:我们开发了RIFT-VAE,这是一种基于Transformer的条件变分自编码器,它接收目标二级结构的上下文无关文法解析树表示,并在相应树上生成核苷酸标签。该框架结合了逐步增强的文法规则、基于生成结构-序列对的自我精炼学习,以及在学习到的潜在空间中进行的交叉熵方法优化。我们在源自RNAcentral的测试集和EteRNA100基准上评估了RNAfold最小自由能一致性,在匹配总时间预算的条件下将该方法与四种基于搜索的求解器进行了比较,并考察了GC含量控制和协方差模型家族注释。 结果:完整流程在源自RNAcentral的测试集上达到了0.833/0.994的RNAfold-Correct/RNAfold-MCC,在EteRNA100上达到了0.760/0.977。潜在空间优化对精确结构恢复率的提升贡献最大。在EteRNA100上给予3,600秒总预算时,当将RIFT-VAE生成的序列用作预热起点时,所有测试的下游搜索方法的精确匹配率均得到提升;其中变化最大的是RNAInverse(Correct:0.297提升至0.803;MCC:0.505提升至0.985)。预训练模型还能够生成可测得正确家族协方差模型命中的序列,并支持显式的GC含量条件控制。 结论:RIFT-VAE更适合被理解为一种生成式-搜索混合框架:预训练提供了一个具有结构和家族信息的提议分布,而潜在优化则将评估集中在高评分区域。所报告的结构评分特指基于RNAfold最小自由能验证的结果,并不能证明生化功能。采用正交折叠预测器、更加严格的同源性控制划分、考虑多样性的评估、与架构匹配的点括号消融实验以及实验测定,仍然是后续验证的重点。

背景:RNA 逆折叠旨在设计预期能够采用给定二级结构的核苷酸序列。基于搜索的求解器能够有效优化折叠模型目标,但对于困难靶标往往需要大量采样;此外,单纯的结构优化并不能显式保留天然 RNA 家族的序列分布或保守基序。方法:我们开发了 RIFT-VAE,一种基于 Transformer 的条件变分自编码器,其输入为目标二级结构的上下文无关文法解析树表示,并在相应树上生成核苷酸标记。该框架结合了逐步丰富的文法规则、基于生成的结构-序列对进行自我精炼学习,以及在所学习潜在空间中的交叉熵方法优化。我们在一个源自 RNAcentral 的测试集和 EteRNA100 基准上评估了 RNAfold 最低自由能一致性;将该方法与四种基于搜索的求解器在匹配的总时间预算下进行比较,并考察了 GC 含量控制与协变模型家族注释。结果:完整流程在源自 RNAcentral 的测试集上达到了 RNAfold-Correct/RNAfold-MCC 为 0.833/0.994,在 EteRNA100 上为 0.760/0.977。潜在空间优化对精确结构恢复的提升幅度最大。在 EteRNA100 上总预算为 3,600 秒时,当将 RIFT-VAE 生成的序列作为热启动输入时,所有测试的下游搜索方法的精确匹配率均得到提高;其中 RNAInverse 的变化最大(Correct:0.297 至 0.803;MCC:0.505 至 0.985)。预训练模型还生成了具有可测量正确家族协变模型命中率的序列,并支持显式 GC 含量条件控制。结论:RIFT-VAE 更适合被解释为一种混合生成-搜索框架:预训练提供结构与家族信息驱动的提议分布,而潜在空间优化则将评估集中于高分区域。所报告的结构评分特指 RNAfold 最低自由能验证,不能证明生化功能。采用正交折叠预测器、更严格的同源性控制划分、考虑多样性的评估、与架构匹配的 dot-bracket 消融实验,以及实验测定,仍是验证的优先事项。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.12.744415v1?rss=1

🏷️ RNA逆向折叠 变分自编码器 Transformer 二级结构设计 潜在空间优化 生成式模型