- 4 次围观
感知到的卡路里含量有助于形成人类腹侧视觉皮层中的神经表征结构,但目前尚不清楚,这一现象反映的是一种抽象的营养信号,还是感知到的卡路里含量在很大程度上可以从食物图像本身的视觉—语义结构中推断出来。在25名女性参与者中,我们采用功能磁共振成像记录了其被动观看96张食物图像时的脑活动,并将感知卡路里评分分解为两个成分:一个是由CLIP(Contrastive Language-Image Pretraining,对比语言—图像预训练)预测的成分;CLIP是一种能够捕捉图像高级视觉—语义结构的视觉—语言模型。另一个则是该基于CLIP的预测未能捕捉到的残差成分。随后,我们采用经过交叉验证的分带岭回归编码模型,检验这两个成分各自对神经预测的贡献。 CLIP可预测的成分沿着加工程度和自然性维度组织食物,将未经加工的单一成分食物与经过加工制备的高能量密度食物区分开来。将该成分加入视觉—语义基线模型后,神经预测能力沿腹侧视觉层级逐步提升,其中在较高层级的腹侧颞叶皮层中,其相对贡献最为显著。这些发现表明,腹侧视觉皮层中的卡路里相关编码主要由一个共同的食物质量轴所承载,该轴反映了加工程度、自然性和感知健康性;其中相当一部分信息可以从图像可计算的视觉—语义结构中恢复,而非为卡路里数量提供一种孤立的抽象表征。由于这些结果来自对25名女性参与者观看固定的96张图像这一实验数据的再分析,因此其能否推广至更广泛的人群以及规模更大、更多样化的刺激集合,仍有待进一步验证。
感知到的热量含量会影响人类腹侧视觉皮层中的神经表征结构,但目前尚不清楚,这一现象反映的是一种抽象的营养信号,还是感知热量主要可以从食物图像本身的视觉—语义结构中推断出来。在25名女性参与者中,我们采用功能性磁共振成像记录其被动观看96张食物图像时的脑活动,并将感知热量评分分解为两个成分:一是由CLIP(Contrastive Language-Image Pretraining,对比语言—图像预训练)图像嵌入所预测的成分;CLIP是一种能够捕捉图像高级视觉—语义结构的视觉—语言模型;二是该基于CLIP的预测未能解释的残差成分。随后,我们利用交叉验证的带状岭回归编码模型,检验这两个成分各自对神经预测的贡献。
CLIP可预测的成分沿着加工度和天然性维度组织食物,将未经加工的单一成分食物与经过制备且能量密度较高的食物区分开来。将该成分加入视觉—语义基线模型后,神经预测能力沿腹侧视觉层级逐步提高,其中相对贡献在较高层级的腹侧颞叶皮层中最为显著。这些发现表明,腹侧视觉皮层中的热量相关编码主要由一个共享的食物质量轴承载,该轴反映食物的加工度、天然性和感知健康程度;其中相当一部分信息可以从图像可计算的视觉—语义结构中恢复,而非为热量大小提供一个相互独立的抽象表征。由于这些结果源于对25名女性参与者观看固定的96张图像所得数据的再分析,因此其能否推广至更广泛的人群以及规模更大、变异性更高的刺激集合,仍有待进一步确立。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.25.747006v1?rss=1
🏷️ 视觉—语言模型 功能磁共振成像 腹侧视觉皮层 食物质量表征 神经编码模型
来源出处
视觉—语言编码模型揭示了人类枕颞皮层中一种可由图像计算的食物质量维度
https://www.biorxiv.org/content/10.64898/2026.08.25.747006v1?rss=1