对捕食果实鱼类一次性拦截行为的建模

由 root 提交于 周五, 09/25/2026 - 08:47
拦截运动物体是动物行为中的一种普遍模式,并具有许多工业应用。受脂鲤科鱼类危地马拉布里肯鱼(Brycon guatemalensis)行为的启发——该鱼能够捕捉落到河面上的果实——我们结合随机最优控制理论与强化学习,研究一次性(即开环)拦截问题。首先,在目标初始状态的估计存在噪声的情况下,智能体通过施加控制量(发射前的等待时间和航向角)来与目标相遇。在一个最简设定中,当发射速度和施加的控制量均为常数时,我们表明,目标测量噪声、控制执行噪声以及智能体的能量守恒都会使最优等待时间缩短。随后,我们推导出航向角方差的一个上界,该上界随非零的最优拦截误差与初始平面间距之比的尺度变化。作为对控制框架的补充,我们的深度强化学习方法表明,代表该鱼的神经网络首先学习拦截任务的价值函数,随后学习瞄准方式,最后学习最优等待时间。除当前具体问题外,我们的研究结果还可能适用于那些几乎没有时间进行反馈或修正的任务,例如栖 perch、着陆和对接。

拦截运动物体是动物行为中的一种普遍模式,并具有广泛的工业应用。受脂鲤科鱼类危地马拉布里肯鱼(*Brycon guatemalensis*)行为的启发——这种鱼会捕捉落到河面上的果实——我们结合随机最优控制理论与强化学习,研究一次性(即开环)拦截问题。首先,在已知目标初始状态存在噪声估计的情况下,智能体通过施加控制(发射前的等待时间和航向角)与目标相遇。在一个最简设定中,当发射速度和所施加的控制量均为常数时,我们证明,目标测量噪声、控制执行噪声以及智能体的能量守恒都会使最优等待时间缩短。随后,我们推导出航向角方差的一个上界,该上界与不可消除的最优拦截误差和初始平面间距之比呈尺度关系。作为对控制框架的补充,我们的深度强化学习方法表明,代表鱼的神经网络首先学习拦截的价值函数,随后学习如何瞄准,最后学习最优等待时间。除当前具体问题外,我们的研究结果还可能适用于反馈或修正时间极少的任务,例如栖 perch、着陆和对接。

感谢您有兴趣帮助传播 bioRxiv 的研究成果。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.17.752477v1?rss=1

🏷️ 动物行为 随机最优控制 深度强化学习 运动拦截建模 捕食行为 鱼类行为学