野生动物行为检测模型:以红腿叫鹤为例

root 提交于 周五, 08/07/2026 - 18:47
基于深度学习的目标检测模型正越来越多地被用于减少行为学研究中视频记录处理所需的人工工作量,但关于生态学家如何自行构建此类模型的可复现工作流程仍然较为缺乏。本文提出了一套用于构建物种特异性检测模型的分步工作流程,并以红腿叫鹤(Cariama cristata)为案例进行应用研究。红腿叫鹤是一种分布广泛但研究不足的新热带鸟类。我们使用了2023年至2026年期间在维索萨联邦大学校园(巴西米纳斯吉拉斯州弗洛雷斯塔尔)通过红外相机陷阱和连续录像摄像机记录的60段视频,从中提取并标注了480张图像,用于训练一个YOLO26-nano检测模型。在验证集上,该模型获得了0.934的精确率和0.786的召回率(mAP@50 = 0.870);而在独立测试集上的表现略低,精确率为0.865,召回率为0.740(mAP@50 = 0.740)。当应用于未见过的视频片段时,该模型在标准CPU上的视频处理速度约为实时速度的4.6倍,并且能够正确判定全部4段测试视频中是否存在叫鹤。大多数漏检都涉及距离较远、部分超出画面范围,或由画质较低的连续录像摄像机记录的叫鹤个体。这些结果表明,利用一个相对较小但经过精心整理的数据集即可构建一个可用的检测模型,而本文配套提供的工作流程和代码旨在降低生态学家将目标检测方法应用于其研究物种的门槛。

基于深度学习的目标检测模型正日益被用于减轻行为学研究中视频记录处理所带来的人工工作负担,但关于生态学家如何自行构建此类模型的可复现工作流程仍然较为匮乏。本文提出了一套用于构建物种特异性检测模型的分步工作流程,并以红腿叫鹤(Cariama cristata)为案例进行应用研究。该物种是一种分布广泛但研究不足的新热带鸟类。利用2023年至2026年间在维索萨联邦大学校园(巴西米纳斯吉拉斯州弗洛雷斯塔尔)通过相机陷阱和连续录像摄像机记录的60段视频,我们提取并标注了480张图像,用于训练一个YOLO26-nano检测模型。在验证集上,该模型取得了0.934的精确率和0.786的召回率(mAP@50 = 0.870);而在独立测试集上的表现略低,精确率为0.865,召回率为0.740(mAP@50 = 0.740)。当应用于未见过的视频片段时,该模型在标准CPU上以约为实时速度4.6倍的速度处理视频,并且能够正确判定全部4段测试视频中是否存在叫鹤。大多数漏检情况涉及距离较远、部分超出画面范围,或由画质较低的连续录像摄像机拍摄到的叫鹤。这些结果表明,基于一个规模相对较小但经过精心整理的数据集,也能够构建出一个可用的检测模型;与此同时,本文配套提供的工作流程和代码旨在降低生态学家将目标检测应用于其自身研究物种时所面临的门槛。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.02.742331v1?rss=1

🏷️ 野生动物监测 动物行为检测 目标检测 深度学习 相机陷阱 红腿叫鹤