- 2 次围观
理解自然场景需要识别其中可见的实体,并表征这些实体之间的关系。近期研究表明,人工神经网络(ANN)、大型语言模型(LLM)和视觉语言模型(VLM)能够预测自然图像所诱发的视觉皮层反应。然而,关系性场景意义的神经组织方式仍知之甚少,部分原因在于,这些模型通常在难以分解为彼此可分离的实体成分和关系成分的全局特征空间中编码场景内容。在本研究中,我们结合场景图标注、行为测量和大规模神经数据集,刻画自然视觉过程中的结构化关系表征。我们采用 RotatE——一种知识图谱嵌入模型——来表征从 7T Natural Scenes Dataset 图像中标注的头实体—关系—尾实体三元组。三元组嵌入能够可靠地捕捉整个视觉层级中的皮层表征结构。行为判断进一步揭示,三元组的可获得性存在系统性差异,而这种差异与视觉属性、关系属性和图结构属性相关。优先考虑行为上更易获得的三元组后,神经对应性得到提升,并且在目标共现、人工神经网络图像特征和大型语言模型图像描述嵌入之外,进一步解释了独特的方差。将三元组表征分解为实体成分和关系成分后,我们发现皮层对二者的贡献部分可分离,其中外侧顶叶皮层对这两类成分均表现出敏感性。基于三元组的语义信息同样保持着空间定位特性:具有视觉场特异性的三元组模型优先预测具有匹配视网膜拓扑偏好的体素。最后,跨物种比较表明,与猕猴颞下皮层相比,基于三元组的语义特征与人类高级视觉皮层的对应程度相对更高。总体而言,这些发现为理解自然场景知觉过程中人类视觉皮层对语义关系信息的表征提供了新的见解。
理解自然场景需要识别其中可见的实体,并表征这些实体之间的关系。近期研究表明,人工神经网络(ANN)、大型语言模型(LLM)和视觉语言模型(VLM)能够预测自然图像所引发的视觉皮层反应。然而,关系性场景意义的神经组织机制仍知之甚少,部分原因在于,这些模型通常在难以分解为相互独立的实体成分和关系成分的全局特征空间中编码场景内容。在本研究中,我们结合场景图标注、行为测量和大规模神经数据集,刻画自然视觉过程中的结构化关系表征。我们采用 RotatE(一种知识图谱嵌入模型),表征针对 7T Natural Scenes Dataset 中图像所标注的头实体–关系–尾实体三元组。三元组嵌入能够可靠地捕捉整个视觉层级中的皮层表征结构。行为判断进一步揭示,三元组的可获取性存在系统性差异,而这种差异与视觉属性、关系属性和图结构属性相关。优先考虑行为上更易获取的三元组,可提升神经对应关系,并在物体共现、ANN 图像特征和 LLM 图像描述嵌入之外解释独特的方差。将三元组表征分解为实体成分和关系成分后,我们发现二者对皮层的贡献部分可分离,其中外侧顶叶皮层对两者均表现出敏感性。基于三元组的语义信息同样保持了空间定位特性:视野特异性的三元组模型优先预测具有匹配视网膜拓扑偏好的体素。最后,跨物种比较表明,与猕猴颞下叶皮层相比,基于三元组的语义特征与人类高级视觉皮层的对应程度相对更高。总体而言,这些发现为理解自然场景知觉过程中人类视觉皮层对语义关系信息的表征提供了新的见解。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.16.752038v1?rss=1
🏷️ 自然场景知觉 视觉皮层表征 场景图 知识图谱嵌入 语义关系信息
来源出处
行为优先级的实体—关系结构捕捉了人类视觉皮层对自然场景的表征
https://www.biorxiv.org/content/10.64898/2026.09.16.752038v1?rss=1