- 4 次围观
学习新行为需要在已学习的动作与根据不断变化的奖励条件进行灵活适应的能力之间取得平衡。这种权衡在背外侧纹状体(dorsolateral striatum,DLS)与背内侧纹状体(dorsomedial striatum,DMS)的分工中得到了充分证实:前者促进对已缓存的、依赖历史的动作进行选择,后者则支持随着奖励条件变化而进行灵活学习。在此,我们提出将策略正则化视为理解这种分工的一般计算原则。容量受限的智能体面临一个基本权衡:一方面最大化奖励,另一方面最小化偏离默认策略的代价;该默认策略缓存了频繁使用的动作转移。我们将这一权衡形式化为一个经KL正则化的奖励目标,其中,灵活控制器(DMS)需要为偏离依赖历史的默认策略(DLS)付出代价。由此得到的最优策略由两部分构成:一是由DMS持续更新的、由奖励驱动的动作价值;二是由DLS缓存的、以动作历史为条件的默认策略。在实际运行中,DLS巩固由DMS的奖励驱动价值学习所塑造的动作转移,因此,即使奖励条件发生变化,DLS仍会保留那些曾经最优的行为,从而产生稳健但缺乏灵活性的动作选择,并有效地对DMS驱动的学习施加“正则化”。我们表明,一个具有单一共享参数集和一致损伤规则的模型,能够统一解释纹状体的功能组织,并再现结果贬值、连续空间反转、熟练动作序列以及运动序列执行等任务中经典的DLS–DMS功能 dissociation。
在本网站搜索该作者
摘要
信息/历史
指标
补充材料
预览 PDF
摘要
学习新行为需要在保持先前习得的动作与灵活适应不断变化的奖励偶联之间取得平衡。这种权衡充分体现在背外侧纹状体(dorsolateral striatum,DLS)与背内侧纹状体(dorsomedial striatum,DMS)的分工中:DLS 促进选择已缓存的、依赖历史的动作,而 DMS 则支持在奖励偶联发生变化时进行灵活学习。在此,我们提出将策略正则化(policy regularization)作为理解这种分工的一般计算原则。受容量限制的智能体面临一个基本权衡:一方面最大化奖励,另一方面最小化偏离默认策略的成本;该默认策略缓存了频繁使用的动作转移。我们将这一权衡形式化为一个经 KL 正则化的奖励目标,其中,灵活控制器(DMS)需要为偏离依赖历史的默认策略(DLS)付出代价。由此得到的最优策略,是由奖励驱动的动作价值与基于动作历史条件化的默认策略共同构成的组合:前者由 DMS 持续更新,后者由 DLS 缓存。在实践中,DLS 巩固由 DMS 的奖励驱动价值学习所塑造的动作转移,因此,即使奖励偶联发生变化,DLS 仍会保留那些曾经最优的行为,从而产生稳健但缺乏灵活性的动作选择,并有效地对 DMS 驱动的学习施加“正则化”。我们表明,一个仅包含一组共享参数并采用一致损毁规则的单一模型,可以统一解释纹状体的功能组织,并在结果贬值、连续空间反转、熟练动作序列以及运动序列执行任务中重现 DLS-DMS 的经典功能解离。
利益冲突声明
作者已声明不存在利益冲突。
已声明的资助方信息
Kempner 自然与人工智能研究所
Schmidt Sciences 颁发的 Polymath 奖
版权
本预印本的。
该预印本依据
CC-BY-NC 4.0 国际许可协议
提供。
返回顶部
上一篇
下一篇
发布于 2026 年 9 月 12 日。
下载 PDF
补充材料
电子邮件
感谢您有意帮助传播 bioRxiv 上的内容。
您的电子邮件地址
*
您的姓名
*
发送至
*
请在不同的行中输入多个地址,或用逗号分隔。
您即将转发以下内容
学习中纹状体分工的统一理论:策略正则化
消息主题
(您的姓名)已从 bioRxiv 向您转发了一个页面
消息正文
(您的姓名)认为您可能会希望查看 bioRxiv 网站上的这一页面。
您的个人留言
验证码
此问题用于测试您是否为人类访客,并防止自动化垃圾邮件提交。
分享
学习中纹状体分工的统一理论:策略正则化
Cheshta Bhatia
,
Samuel J Gershman
,
Lucy Lai
bioRxiv
2026.09.10.750654;
doi:
https://doi.org/10.64898/2026.09.10.750654
分享本文:
复制
引用工具
学习中纹状体分工的统一理论:策略正则化
Cheshta Bhatia
,
Samuel J Gershman
,
Lucy Lai
bioRxiv
2026.09.10.750654;
doi:
https://doi.org/10.64898/2026.09.10.750654
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.10.750654v1?rss=1
🏷️ 策略正则化 背外侧纹状体 背内侧纹状体 强化学习 动作选择 KL正则化