- 4 次围观
适应性行为要求个体能够在利用熟悉奖励与探索新机会之间灵活切换。这类探索—利用决策由一个分布式脑网络加以实现,该网络以前极皮层(FPC)和腹内侧前额叶皮层(vmPFC)为核心,通过权衡熟悉选项的即时价值与探索的潜在未来价值,来计算特定选择的总体价值。要阐明大脑如何处理这一权衡,关键在于捕捉这些神经计算在空间分布的皮层网络中的精确时间动态。在本研究中,我们在一项强化学习任务中结合使用脑磁图(MEG)与部分可观测马尔可夫决策过程(POMDP)建模。通过在MEG源空间中解码基于POMDP推导出的选择策略,我们描绘了探索—利用决策在整个皮层中精确的时空涌现过程。 我们证明,探索—利用策略的实施是通过吻侧前额叶皮层内的层级性功能分离而展开的。在决策形成过程中,外侧前极皮层(lateral FPC)在选择执行前数百毫秒便启动了向探索的策略性转移。相反,腹内侧前额叶皮层(vmPFC)和眶额皮层(OFC)在探索试次中并未在早期表现出相对于基线利用轨迹的显著偏离,而仅在选择执行前显示出延迟且短暂的峰值。反馈之后,vmPFC和OFC转而对选择的经验价值进行持续表征,以更新奖励预期并指导未来行为。将强化学习变量映射到毫秒级时间分辨率的神经数据上,揭示了人脑如何解决探索—利用困境:通过FPC中对探索的早期策略性启动、vmPFC和OFC中延迟的探索性转移,以及对结果的持续评估来优化未来行为。
适应性行为要求个体能够在利用熟悉奖励与探索新机会之间进行灵活切换。这些探索—利用决策由一个分布式脑网络实现,该网络以额极前皮层(FPC)和腹内侧前额叶皮层(vmPFC)为枢纽,通过权衡熟悉选项的即时价值与探索的潜在未来价值,来计算特定选择的总体价值。精确刻画这些神经计算在空间分布的皮层网络中的时间动态,对于阐明大脑如何管理这一权衡至关重要。
在本研究中,我们将脑磁图(MEG)与部分可观测马尔可夫决策过程(POMDP)建模相结合,并应用于一项强化学习任务。通过在MEG源空间中解码POMDP推导的选择策略,我们描绘了探索—利用决策在整个皮层中的精确时空出现过程。我们证明,探索—利用策略的实施通过吻侧前额叶皮层内一种层级性的功能分离而展开。在决策形成过程中,外侧FPC在选择执行前数百毫秒便启动了向探索的策略性转移。相反,vmPFC和眶额皮层(OFC)在探索试次中并未表现出相对于基线利用轨迹的早期显著偏离,而仅在选择执行前呈现出延迟且短暂的峰值。
在反馈之后,vmPFC和OFC转而对选择的经验价值进行持续表征,以更新奖励预期并指导未来行为。将强化学习变量映射到毫秒级时间分辨的神经数据上,揭示了人脑如何解决探索—利用困境:通过FPC中对探索的早期策略性启动、vmPFC和OFC中延迟的探索性转移,以及对结果的持续评估来优化未来行为。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.06.01.729427v1?rss=1
🏷️ 探索—利用决策 脑磁图 强化学习 POMDP 前额叶皮层 时空解码
来源出处