低维因子化神经计算构成风险适应性选择的基础

root 提交于 周二, 08/18/2026 - 16:47
现实世界中的决策很少在信息完美的情况下发生。相反,个体必须不断权衡潜在回报与不利结果发生的概率。1 这一过程的失败会导致适应不良的决策,并与终生成功率降低以及多种精神障碍相关,例如赌博成瘾、神经性贪食症和物质使用障碍。2,3 促进对潜在结果分布进行推断的神经计算机制仍不清楚,但一般认为其发生于分布式的额颞叶环路中。4 在本研究中,我们使用深度强化学习智能体来预测在一项风险决策任务中不同的行为策略及其潜在的神经群体动力学。在一系列训练条件下,深度强化学习智能体分化为两类策略:一类表现为对奖励偶然性空间的过度谨慎探索,另一类则表现为高绩效、风险适应性的双峰策略(Bimodal strategy)。高绩效双峰智能体的内部动力学形成了低维表征,可将安全状态与风险状态区分开来。相比之下,谨慎探索型智能体则与更为偏斜且相互缠结的神经表征相关。我们在人类癫痫患者执行一项类似风险决策任务时记录的神经元集群活动中,发现了极其相似的动力学表征及其相关的行为策略。这些结果揭示了不确定结果推断及其相关行为策略背后的动力学计算结构。

现实世界中的决策很少在信息完备的条件下发生。相反,个体必须不断权衡潜在回报与不良结果发生的概率。1 这一过程的失效会导致适应不良的决策,并与终生成功率降低以及诸多精神障碍相关,例如赌博成瘾、神经性贪食症和物质使用障碍。2,3 促进对潜在结果图景进行推断的神经计算机制仍不明确,但一般认为其发生于分布式额颞叶环路中。4 在本研究中,我们利用深度强化学习智能体来预测风险决策任务中不同的行为策略及其潜在的神经群体动力学。在一系列训练条件下,深度强化学习智能体分化为两类策略:一类表现为对奖赏偶然性空间的过度谨慎探索,另一类则表现为高绩效、风险自适应的双峰策略。高绩效双峰智能体的内部动力学形成了低维表征,从而将安全状态与风险状态区分开来。相比之下,谨慎探索智能体则与更加偏斜且相互缠结的神经表征相关。我们在人类癫痫患者执行类似风险决策任务时记录到的神经元群活动中,发现了极为相似的动力学表征及其相关行为策略。这些结果揭示了不确定结果推断及其相关行为策略背后的动力学计算结构。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.12.744223v1?rss=1

🏷️ 风险决策 深度强化学习 神经群体动力学 低维表征 行为策略