零样本评估揭示了大脑预测模型在结构化泛化方面的局限性

由 root 提交于 周二, 09/22/2026 - 08:47
人工神经网络(ANNs)能够以惊人的准确度预测自然图像所引发的神经反应,因此有望成为人类视觉的模型。然而,仅凭预测得分,我们很难了解这些模型究竟捕捉到了哪些计算过程,也难以判断它们在训练所用图像之外的泛化能力。在此,我们提出了一种具有理论原则的零样本模型评估框架:在测试之前冻结基于人工神经网络的编码模型,并不仅在留出的图像上进行测试,还在全新的数据集上进行测试。我们最具挑战性的测试将数十年来的认知神经科学实验重新用作诊断性基准,以识别当前模型所捕捉的计算过程,以及它们在哪些方面存在不足。为实施这一框架,我们利用多个预训练人工神经网络构建了人类类别选择性脑区(梭状回面孔区,FFA;海马旁回场景区,PPA;以及外侧体区,EBA)的编码模型,并在7个独立的功能磁共振成像(fMRI)数据集和来自10项已发表研究的31项认知实验中,对这些固定模型进行了评估。 该框架揭示了三种总体模式。第一,零样本评估暴露出了模型预测能力的系统性局限,而这些局限在标准的同数据集交叉验证中基本上被掩盖了。这些局限具有结构性差异,因脑区和模型类别而异,并且强烈依赖于用于构建模型和测试模型的图像之间的相似性。第二,当前模型能够复现认知神经科学中的部分经典发现,但并非全部,从而为诊断当前模型尚未捕捉到的计算过程提供了依据。最后,在预测测试中表现良好的模型,通常也更有可能成功复现认知神经科学发现,这表明预测与解释之间存在密切联系。然而,与预测得分不同,认知测试有助于诊断模型失败的具体位置及其原因。总体而言,零样本评估框架为在预测测试和认知神经科学测试中评估脑模型提供了一种可扩展且统一的方法,有助于我们更好地理解当前模型捕捉到了什么,以及哪些问题仍有待解释。

人工神经网络(ANN)能够以非凡的准确性预测人类对自然图像的神经反应,因此有望成为人类视觉的模型。然而,单凭预测得分,我们几乎无法了解这些模型捕获了哪些计算过程,也无法判断它们能否推广到训练所用图像之外的情境。在此,我们提出一种原则性的零样本模型评估框架:在测试基于人工神经网络的编码模型之前将其冻结,然后不仅在留出图像上进行测试,还在全新的数据集上进行测试。我们的最强测试将数十年来的认知神经科学实验重新用作诊断性基准,以识别当前模型捕获了哪些计算过程,以及它们在哪些方面存在不足。为实施这一框架,我们使用多个预训练人工神经网络构建了人类类别选择性脑区(梭状回面孔区〔FFA〕、海马旁回场景区〔PPA〕和外侧枕叶体部区〔EBA〕)的编码模型,并在7个独立的功能性磁共振成像(fMRI)数据集以及10项已发表研究中的31项认知实验上,对这些固定模型进行了评估。

该框架揭示了三种广泛存在的模式。首先,零样本评估暴露出模型预测能力的系统性局限,而这些局限在标准的同数据集交叉验证中大多未能显现。这些局限具有结构化特征,会随脑区和模型类别而变化,并且在很大程度上取决于用于构建模型和测试模型的图像之间的相似性。其次,当前模型能够复现认知神经科学中的部分经典发现,但并非全部,从而揭示了当前模型尚未捕获的计算过程。最后,在预测测试中表现良好的模型,往往也更有可能成功复现认知神经科学发现,这表明预测与解释之间存在密切联系。然而,与预测得分不同,认知测试能够帮助诊断模型在哪些方面以及为何会失败。总体而言,零样本评估框架为跨越预测测试和认知神经科学测试评估脑模型提供了一种可扩展且统一的方法,有助于我们更好地理解当前模型捕获了哪些内容,以及哪些问题仍有待解释。


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.15.751562v1?rss=1

🏷️ 零样本评估 人工神经网络 视觉神经科学 脑编码模型 功能磁共振成像 结构化泛化