- 1次围观
大脑中的神经元通常与运动神经元之间相隔多个突触,然而,如果某个运动产生了误差,那么每一个远距离的神经元都需要一个“教师”,该教师能够考虑其对该运动生成所作出的特定贡献。这一信用分配问题在机器学习中是通过对损失函数进行梯度下降来解决的,其中损失定义了误差所带来的主观代价。大脑是否也使用梯度下降来指导单个神经元的学习?我们训练狨猴对视觉目标进行扫视,然后通过为每个目标赋予奖励价值来改变损失。作为小脑中浦肯野细胞(P-cells)教师信号的攀缘纤维,采用一种乘法编码方式,将误差向量的空间属性与其奖励属性进行缩放整合,并纳入了奖励预测误差。通过利用尖峰触发的浦肯野细胞抑制,我们量化了将每个浦肯野细胞输出映射到眼动的效应向量,并发现攀缘纤维并非仅仅在传递误差。相反,它们所提供的信号平均而言与奖励依赖性误差向量在该浦肯野细胞效应向量上的点积成正比。因此,攀缘纤维通过提供相对于各自浦肯野细胞输出的损失函数梯度,解决了信用分配问题。
大脑中的神经元往往与运动神经元之间相隔多个突触;然而,如果一次运动产生了误差,那么每个远端神经元都需要一个能够考虑其对该运动生成之特定贡献的“教师”。这种信用分配问题在机器学习中是通过对损失函数进行梯度下降来解决的,其中损失定义了误差所带来的主观代价。大脑是否利用梯度下降来指导单个神经元?
我们训练狨猴对视觉目标进行扫视,随后通过为每个目标赋予奖励价值来改变损失。攀缘纤维作为小脑中浦肯野细胞(P-cells)的教师,采用一种乘法性编码方式,将误差向量的空间属性与其奖励属性进行缩放,并纳入了奖励预测误差。通过利用尖峰触发的浦肯野细胞抑制,我们量化了将每个浦肯野细胞输出映射到眼动的效应向量,并发现攀缘纤维并非仅仅在传递误差。相反,它们所提供的信号在平均意义上与奖励依赖性误差向量在该浦肯野细胞效应向量上的点积成正比。因此,攀缘纤维通过提供相对于各自浦肯野细胞输出的损失函数梯度,解决了信用分配问题。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.07.27.741034v1?rss=1
🏷️ 小脑 爬行纤维 浦肯野细胞 梯度编码 奖励预测误差 运动学习
来源出处
爬行纤维为小脑编码损失函数的梯度
https://www.biorxiv.org/content/10.64898/2026.07.27.741034v1?rss=1