盗窃再犯者探索—利用决策背后的强化学习障碍

root 提交于 周四, 09/17/2026 - 12:47
盗窃行为给社会和经济造成了深重负担;然而,惩罚性司法措施往往无法有效遏制再犯。对于盗窃再犯者而言,无论其惯常犯罪行为属于工具性盗窃还是盗窃癖所致,驱动其反复犯罪的神经行为机制仍缺乏充分认识。本研究采用四臂多臂老虎机任务,考察盗窃再犯者的探索—利用决策及其潜在的强化学习架构,同时利用功能性近红外光谱技术(fNIRS)连续监测其前额叶皮层(PFC)的血流动力学变化。无模型行为分析显示,与无犯罪记录的对照个体(CT)相比,非盗窃癖盗窃再犯者(TR-K)而非盗窃癖盗窃再犯者(TR+K)表现出显著更高的累积后悔值,并作出更少的最优选择。基于变分贝叶斯分析的有模型分析确定,带衰减的Q学习模型具有最佳的计算拟合效果。利用该模型提取参数后发现,TR-K组的学习率低于CT组和TR+K组,表明其在获得环境反馈后更新行动价值方面存在学习缺陷。对逐试次潜在强化变量的fNIRS追踪显示,尽管前额叶活动会受到这些变量的调节,但组间差异主要表现为静态基线血流动力学偏移,而非价值追踪神经回路的重新连接。这些发现提示,非盗窃癖的反复盗窃行为可能与受损的强化学习机制有关,从而对当前以惩罚性威慑为基础的模型提出了挑战。

盗窃行为给社会和经济带来了深重负担;然而,惩罚性司法措施往往无法有效遏制再犯。对于盗窃再犯者而言,无论其惯常犯罪行为是工具性盗窃还是盗窃癖所致,驱动其持续犯罪的神经行为机制仍知之甚少。本研究采用四臂多臂老虎机任务,考察盗窃再犯者的探索—利用决策及其潜在的强化学习架构,同时使用功能性近红外光谱(fNIRS)连续监测其前额叶皮层(PFC)的血流动力学活动。无模型行为分析显示,与无犯罪记录的对照个体(CT)相比,非盗窃癖盗窃再犯者(TR-K)而非盗窃癖盗窃再犯者(TR+K)累积了显著更高的累积遗憾值,并作出了更少的最优选择。基于变分贝叶斯分析的模型分析确定,带衰减的Q学习模型具有最佳的计算拟合效果。利用该模型提取参数后发现,TR-K组的学习率低于CT组和TR+K组,表明其在获得环境反馈后更新行动价值方面存在学习缺陷。逐试次追踪潜在强化变量的fNIRS分析显示,尽管前额叶皮层活动受到这些变量的调节,但组间差异表现为静态基线血流动力学偏移,而非价值追踪神经回路的重新连接。这些发现表明,非盗窃癖的反复盗窃行为可能与受损的强化学习机制有关,从而对当前基于惩罚的威慑模型提出了挑战。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.11.750836v1?rss=1

🏷️ 盗窃再犯 强化学习障碍 探索—利用决策 前额叶皮层 功能性近红外光谱 学习率异常