思维即规划:通过强化规划优化思维链的潜在世界模型

由 root 提交于 周五, 10/09/2026 - 08:47

大型语言模型(LLM)在多种自然语言处理(NLP)任务中的成功,提升了推理链优化的重要性,使其成为使模型行为与任务目标保持一致的关键步骤。现有的推理链调优方法通常依赖黑盒启发式方法或无梯度搜索,因此在可解释性、泛化能力和样本效率方面存在不足。在本研究中,我们提出了 \textbf{Thoughts-as-Planning},一种新颖的框架,将推理链优化形式化为潜在语义空间上的序贯决策过程。我们将LLM建模为一个部分可观测环境,并学习一个潜在世界模型,用于模拟推理链编辑对下游输出的影响。我们构建了一个保持邻近关系的嵌入空间,以编码推理链—响应动态,从而支持通过梯度下降或强化学习进行规划。该方法支持多尺度抽象,使得能够在统一规划器中整合令牌级、片段级和指令级的推理链编辑。通过在语言理解和生成任务上的广泛实验,我们证明,Thoughts-as-Planning在效率、稳健性和泛化能力方面均优于当前最先进的推理链调优基线方法,同时还能够通过其结构化的规划轨迹提供可解释性。我们的代码可在 \url{https://github.com/FastLM/Thoughts-as-Planning} 获取。

作者声明不存在利益冲突。

感谢您有兴趣传播 bioRxiv 的相关信息。

注意:请求提供您的电子邮件地址仅用于确认您是本文的发送者。

关键词:大型语言模型 · 思维链优化 · 强化学习 · 潜在世界模型 · 序贯决策 · 自然语言处理

原文链接:https://www.biorxiv.org/content/10.64898/2026.05.10.724161v1?rss=1