- 4 次围观
上颞沟(STS)对多模态社会互动具有选择性反应。然而,迄今为止的研究主要依赖预先定义的、简化的刺激或特征来揭示驱动STS活动的信息类型。我们假设,来自视觉和听觉深度学习模型的高维表征能够更好地预测STS对自然情境下社会互动的反应。 我们使用自监督视觉和听觉深度学习模型,分别提取参与者在fMRI扫描期间观看的一部电视剧中的画面帧和音频表征。基于体素的编码模型表明,联合视觉—听觉表征在预测STS反应方面优于人工构建的社会—情感标注。方差分解进一步揭示了STS内部从后部到前部的视觉—听觉梯度。 为了解释这些模型所编码的内容,我们对编码模型权重进行了主成分分析。在视觉和听觉模型中,第一维度均追踪社会互动,并在STS中达到峰值,这表明社会互动是STS在两种模态下表征的主导维度。我们得出结论:STS以多模态方式表征自然情境下的社会互动,整合了视觉和听觉信息;同时,视觉和听觉深度学习模型捕捉到了这些反应的关键表征特性。
上颞沟(STS)对多模态社会互动表现出选择性反应。然而,迄今为止的研究主要依赖预先定义的、简化的刺激或特征来揭示驱动STS活动的信息类型。我们假设,来自视觉和听觉深度学习模型的高维表征能够更好地预测STS对自然主义社会互动的反应。
我们使用自监督视觉和听觉深度学习模型,分别提取参与者在fMRI扫描期间观看的一部电视剧的画面帧和音频表征。基于体素的编码模型表明,联合视觉—听觉表征在预测STS反应方面优于人工制作的社会—情感标注。方差分解进一步揭示了STS内部从后向前的视觉—听觉梯度。
为了解释这些模型所编码的内容,我们对编码模型权重应用了主成分分析。在视觉和听觉模型中,第一维度都追踪社会互动,并在STS中达到峰值,这表明社会互动是STS在两种模态下表征的主导维度。我们得出结论:STS以多模态方式表征自然主义社会互动,整合视觉与听觉信息;同时,视觉和听觉深度学习模型捕捉到了这些反应的关键表征特性。
📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.08.13.744446v1?rss=1
🏷️ 上颞沟 社会互动 fMRI 多模态表征 深度学习编码模型
来源出处
视觉和听觉深度学习模型捕捉了上颞沟中自然主义社会互动的神经表征
https://www.biorxiv.org/content/10.64898/2026.08.13.744446v1?rss=1