SAIL:用于实现人类视觉与多模态大型语言模型可解释对齐的稀疏自编码器

由 root 提交于 周三, 10/07/2026 - 10:47
人类高级视觉表征与多模态大语言模型(MLLM)视觉表征之间的一致性,为理解人类视觉中的信息加工提供了一个定量框架。然而,模型表征与脑表征之间的相似性并不能直接揭示其对应关系背后的语义内容,因为这种内容难以从纠缠的 MLLM 表征中分离出来。在此,我们提出 SAIL,一种可解释框架,将体素解释表述为 MLLM 与人类视觉之间的多单元稀疏语义对应问题。首先,我们在自然场景数据集(Natural Scenes Dataset)中的图像及其描述所对应的 MLLM 表征上训练统一的跨层稀疏自编码器(SAE),并将每个脑体素与多个 SAE 单元进行对齐。其次,我们量化这些单元与体素各自高响应图像集合之间的语义相似性,以描绘跨皮层的语义对齐。随后,我们将多个语义标签投射回皮层,以解释这种对齐所包含的内容。最后,我们利用独立的 fLoc 实验中测量的类别反应,对这些对应关系进行评估。与在每一层独立训练的 SAE 相比,SAIL 所呈现的 SAE 单元反应谱具有更低的冗余性和更高的语义对齐度。我们发现,在所考察的模型和被试中,语义对齐沿人类腹侧视觉通路呈现出组织化分布。投射得到的标签揭示了典型视觉区域中的语义偏好,而 fLoc 实验表明,预测的类别反应模式与实测模式相一致。进一步的探索性分析揭示了与既有功能学解释一致的动作相关语义在皮层中的分布,这些解释涉及外侧枕颞皮层和后顶叶皮层。总体而言,SAIL 为 MLLM 表征与人类视觉反应之间的语义对应关系提供了一种可解释的描述。

SAIL:用于人类视觉与多模态大语言模型可解释对齐的稀疏自编码器 | bioRxiv

跳转至主要内容

主页

关于

投稿

提醒 / RSS

搜索关键词

高级搜索

最新结果

SAIL:用于人类视觉与多模态大语言模型可解释对齐的稀疏自编码器

Tan Gao,

Luyuan Zhang,

Yifei Wang,

Yunjia Wang,

Haotian Zhou,

Mufan Xue,

Guoyuan Yang

doi:

https://doi.org/10.64898/2026.09.30.755515

Tan Gao

北京理工大学

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Luyuan Zhang

北京理工大学

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Yifei Wang

北京理工大学

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Yunjia Wang

北京理工大学

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Haotian Zhou

北京理工大学

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Mufan Xue

北京理工大学

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

Guoyuan Yang

北京理工大学

在 Google Scholar 中查找该作者

在 PubMed 中查找该作者

在本网站搜索该作者

通讯作者:

yanggy{at}bit.edu.cn

摘要

信息/历史

指标

预览 PDF

摘要

人类高级视觉表征与多模态大语言模型(MLLM)视觉表征之间的对齐,为理解人类视觉中的信息处理提供了一个定量框架。

然而,模型表征与脑表征之间的相似性并不能直接揭示其对应关系背后的语义内容,因为在纠缠的 MLLM 表征中,这些内容难以被分离出来。在此,我们提出 SAIL,这是一种可解释框架,将体素解释形式化为 MLLM 与人类视觉之间的多单元稀疏语义对应问题。首先,我们基于自然场景数据集图像及其描述文本的 MLLM 表征,训练统一的跨层稀疏自编码器(SAE),并将每个脑体素与多个 SAE 单元进行对齐。其次,我们量化这些单元最高响应图像集合之间的语义相似性,以绘制跨大脑皮层的语义对齐图谱。随后,我们将多个语义标签投影回大脑皮层,以解释这种对齐关系所包含的内容。最后,我们利用独立 fLoc 实验中测量的类别响应,对这些对应关系进行评估。与在每一层独立训练的 SAE 相比,SAIL 的 SAE 单元响应模式冗余度更低,语义对齐程度更高。我们发现,在所考察的模型和受试者中,语义对齐沿人类腹侧视觉通路呈现组织化分布。投影后的标签揭示了经典视觉区域内部的语义偏好,而 fLoc 实验显示,预测的类别响应模式与实测模式之间具有一致性。进一步的探索性分析揭示了与既有功能学解释相一致的动作相关语义皮层分布,涉及外侧枕颞皮层和后顶叶皮层。总体而言,SAIL 为 MLLM 表征与人类视觉反应之间的语义对应关系提供了一种可解释的说明。

利益冲突声明

版权

本预印本的。

该文档依据

CC-BY 4.0 国际许可协议

提供。

返回顶部

上一篇

发布于 2026 年 10 月 06 日。

下载 PDF

电子邮件

感谢您有意传播 bioRxiv 上的内容。

身份。

您的电子邮件地址

*

您的姓名

*

发送至

*

请输入多个地址,每行一个,或使用逗号分隔。

您将要发送以下内容:

SAIL:用于人类视觉与多模态大语言模型可解释对齐的稀疏自编码器

邮件主题

(您的姓名)从 bioRxiv 网站转发了一个页面给您

邮件正文

(您的姓名)认为您可能会希望查看 bioRxiv 网站上的这一页面。

您的个人留言

验证码

此问题用于测试您是否为人类访客,并防止自动垃圾邮件提交。

分享

SAIL:用于人类视觉与多模态大语言模型可解释对齐的稀疏自编码器

Tan Gao,

Luyuan Zhang,

Yifei Wang,

Yunjia Wang,

Haotian Zhou,

Mufan Xue,

Guoyuan Yang

bioRxiv

2026.09.30.755515;

doi:

https://doi.org/10.64898/2026.09.30.755515

分享本文:

复制

引文工具

SAIL:用于人类视觉与多模态大语言模型可解释对齐的稀疏自编码器

Tan Gao,

Luyuan Zhang,

Yifei Wang,

Yunjia Wang,

Haotian Zhou,

Mufan Xue,

Guoyuan Yang

bioRxiv

2026.09.30.755515;

doi:

https://doi.org/10.64898/2026.09.30.755515


📄 原文链接:https://www.biorxiv.org/content/10.64898/2026.09.30.755515v1?rss=1

🏷️ 多模态大型语言模型 稀疏自编码器 人类视觉表征 脑-模型对齐 视觉皮层语义组织