- 2 次围观
觅食是一种普遍存在于动物界的行为,近年来日益引起实验研究者和理论研究者的共同兴趣。以往大多数模型都假定动物知道其环境中资源的分布,但这种结构实际上必须在动物探索环境的过程中被学习。因此,觅食可以被视为一个层级推断问题。我们提出了一个规范性的贝叶斯理论框架,用以描述智能体在开发一个斑块化环境的同时学习该环境,并表明资源耗竭会以不同方式塑造这一层级中的各个层次。在单个斑块内部,资源耗竭会加速对资源到达速率的学习,因为连续遭遇事件发生在不断下降的速率下,而这些事件之间的时间间隔能够锁定初始速率。在斑块之间,组成学习,即推断高产斑块所占比例,则是缓慢的,它由被采样斑块的数量而非在每个斑块中花费的时间所决定;一旦速率已知,这一过程便不再受资源耗竭影响。因此,以奖励最大化为目标的策略与以信息获取为目标的策略会发生分化:为了弄清环境组成,觅食者会对富饶斑块采收不足,因为学习这一组成需要离开当前斑块,而这种分化在初始暴露阶段最为明显。当一个固定的斑块集合会在两次访问之间得到补充时,奖励最大化策略会收敛为围绕高产斑块的稳定轨道,而补充速率决定了觅食者是绘制整个环境的图谱,还是锁定于一个富饶的子集。何种离开规则能够使摄入量最大化,本身又取决于斑块的变异程度;一旦斑块丰富度的变异超过大约四分之一,最优规则就会从计数猎物数量切换为计时猎物出现之间的间隔。因此,相较于仅从奖励中学习一条规则,对环境本身进行学习能够显著提高摄入量,前提是其关于资源耗竭的假设为真实情况留下了空间。
觅食是一种普遍存在的动物行为,日益受到实验研究者和理论研究者的关注。以往的大多数模型都假设动物知晓其环境中的资源分布,但这种结构必须在探索环境的过程中逐步学习。因此,觅食可以被视为一个层级推断问题。我们提出了一个规范性的贝叶斯理论,用于描述智能体在利用斑块化环境的同时学习该环境,并表明资源耗竭以不同方式塑造这一层级结构。在斑块内部,资源耗竭会加速速率学习,因为连续遭遇以不断下降的速率发生,而这些遭遇之间的间隔能够确定初始速率。在斑块之间,组成学习,即推断高产斑块所占的比例,则较为缓慢,其速度取决于所采样的斑块数量,而非在每个斑块中停留的时间;一旦速率已知,组成学习便不再受资源耗竭的影响。因此,奖励最大化策略与信息寻求策略会发生分歧:为了确定环境组成,觅食者必须离开当前斑块,从而对高产斑块的利用不足;这一现象在初次接触环境的早期阶段最为明显。当一组固定的斑块在两次访问之间得到补充时,奖励最大化策略会收敛为围绕高产斑块的稳定循环,而补充速率则决定觅食者是绘制整个环境的资源分布图,还是锁定于其中一个高产子集。究竟哪一种离开规则能够最大化摄取量,本身取决于斑块的变异程度:当斑块丰度的差异超过约四分之一时,最优策略会从计数猎物转变为计时猎物之间的间隔。由此可见,只要关于资源耗竭的假设为真实情况留下了空间,学习环境便能够比仅凭奖励学习一条行为规则带来显著更高的摄取量。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.31.742044v1?rss=1
🏷️ 动物觅食行为 资源耗竭 贝叶斯推断 层级学习 斑块化环境 奖励最大化
来源出处
资源耗竭加快斑块觅食中的速率学习,但不加快组成学习
https://www.biorxiv.org/content/10.64898/2026.07.31.742044v1?rss=1