- 2 次围观
理解大脑如何支持灵活的目标导向行为是神经科学的核心目标之一。然而,这类行为具有高度可变性,并在较长时间尺度上展开,因此要理解其组织方式颇具挑战。行为追踪技术的进步能够对运动进行量化,却无法揭示引导这些运动的目标。基于此,我们将逆强化学习(inverse reinforcement learning,IRL)发展为一个从自然行为中推断这些目标的通用框架。我们的方法将动物的目标表征为内部奖励,并从观察到的行为中同时推断这些奖励及其所诱导的策略。该方法适用于多种行为情境,从自由活动行为到结构化任务均可应用;还能够推断随时间切换或随经验逐渐变化的目标。在捕捉蟋蟀的小鼠中,该方法识别出一组数量较少的目标,动物在一次试验过程中会在这些目标之间进行切换。在学习线索迷宫的小鼠中,该方法推断出随着学习进程推进,动物的内部奖励如何发生变化。在两组数据中,模型均能预测留出动作,并生成持续时间较长的行为,从而再现动物行为表现的关键特征。通过将漫长且多变的行为序列转化为随时间变化的动物目标估计,我们的方法为研究大脑如何组织自然行为提供了定量基础。
理解大脑如何支持灵活的目标导向行为是神经科学的核心目标之一。然而,此类行为具有高度可变性,并且在较长时间尺度上展开,因此要理解其组织方式颇具挑战。行为追踪技术的进步使运动能够被量化,但无法揭示引导这些运动的目标。基于这一问题,我们将逆向强化学习(inverse reinforcement learning,IRL)发展为一种通用框架,用于从自然行为中推断这些目标。我们的方法将动物的目标表征为内部奖励,并根据观察到的行为同时推断这些奖励及其所诱导的策略。该方法适用于多种行为情境,从自由活动行为到结构化任务均可应用;同时还能够推断随时间切换的目标,或随经验逐渐变化的目标。在捕捉蟋蟀的小鼠中,该方法识别出一组数量较少的目标,动物在一次试验过程中会在这些目标之间进行切换。在学习提示迷宫的小鼠中,该方法推断出随着学习进程推进,动物的内部奖励如何发生变化。在这两组数据中,模型均能预测留出动作,并生成较长时间跨度的行为,从而再现动物表现的关键特征。通过将漫长且多变的行为序列转化为动物目标的时间分辨估计,我们的方法为研究大脑如何组织自然行为提供了定量基础。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.25.754554v1?rss=1
🏷️ 逆强化学习 动物行为目标推断 内部奖励表征 自然行为建模 目标导向行为 计算神经科学
来源出处