人类与猕猴视觉皮层共享高维物体空间,深层 DNN 更贴近人脑

2026-08-13

对 8,640 张图像的人脑 fMRI 和猕猴多电极记录做跨物种对齐,发现共享一个丰富的高维物体空间,且深层 DNN 更好预测人类 IT、浅层更好预测猕猴 IT。

这篇在解决什么

下颞叶皮层(IT)是灵长类识别物体的核心脑区,人类和猕猴都有。两者对同一批物体,大脑里的表征到底有多像?过去的工作确认了几个粗粒度的对应,比如「有没有生命」和「形状」,但不确定这种相似是只停在少数几根轴上,还是一整片高维的几何结构。这个空白有两层后果:一是能不能拿猕猴的颅内数据去推断人类视觉机制,二是现在常被用来「解释」视觉皮层的深度网络,究竟在多大程度上复现了生物视觉、复现的是哪个物种那一套。

方法

同一批 8,640 张自然物体图像,分别给猕猴做颅内多电极记录、给人类做 fMRI。用多集合典型相关分析(MCCA)这种多变量方法,在两类数据之间对齐出一个共享的「物体空间」。

真正让这篇和 AI 接上轨的,是他们把 7 个 DNN(目标函数、架构、训练集各不相同)当作编码模型:取每个网络各层激活,用交叉验证的岭回归去预测两个物种的脑空间。这样就能问一个具体问题:哪个物种的 IT 对应 DNN 的哪一层。他们还用这些 DNN 的浅层激活拼成一个「控制嵌入」,把低级视觉特征回归掉,用来检验某个效应是不是只来自像素层面的低级特征,而非高层结构。

结果

指标人类 IT猕猴 IT
概念信息解释度 R²0.0710.042
视觉信息解释度 R²0.0220.032
DNN 最佳层预测 R²0.196–0.2360.177–0.218
对齐的 DNN 层位深层(60–100%)浅层(0–20%)

共享空间比预想丰富得多,不止「有生命/无生命」这几根轴,而是一大堆可解释的视觉和概念维度,以及两者的混合。

人类 IT 更被高层概念信息预测(概念 R²=0.071,远高于视觉的 0.022),猕猴两边更均衡(0.042 对 0.032)。DNN 层级把这层差异照了出来:7 个网络在最优点表现接近(人类 R²=0.196–0.236,猕猴 0.177–0.218),但按深度切片,最浅的 0–20% 段预测猕猴更好(p=0.012),最深的 60–100% 段预测人类更好(p≤0.002)。人脑 IT 对齐 DNN 深层,猕猴对齐浅层。

还有一个意外:共享空间里能解码出符号、图标、多物体组合,两个物种都成立。把浅层 DNN 特征回归掉之后,解码掉了一截(降 0.08–0.20 AUC)但仍显著高于随机。这意味着猕猴 IT 里可能藏着一种「正字法前体」,也就是对文字、符号视觉形式的敏感性,而猕猴并不识字。这种解码从初级视皮层 V1 到 IT 在两个物种里都增强。另外两物种都偏爱自己同类:人类空间富集人体部位,猕猴空间富集猴子图像。

为什么重要

对做表征学习和视觉模型的人,这是「DNN 哪一层像哪部分脑」的一次带物种维度的标定。以前笼统说「DNN 像 IT」,现在能区分:DNN 的不同深度对应不同物种、不同抽象层级,深层更像负责高层概念的人脑 IT,浅层更像偏视觉的猕猴 IT。这也给「DNN 是不是好的脑模型」这个老问题加了一个常被忽略的变量:物种。对拿猕猴数据外推人类结论的人,这篇提醒两者在概念抽象度上系统性地不同,不能直接搬。

局限与存疑

作者自己承认最大的软肋是模态混杂:人类是 fMRI,猕猴是颅内多电极,采样脑区和任务参数都不一样,物种差异和方法学差异没法完全拆开,物种内部的对比尤其要谨慎。

另一个隐患更普遍,也更容易被忽视:概念预测器和 DNN embedding 本身可能带人类偏差。DNN 深层是在人类整理的数据集上训练出来的,自然更偏人类空间,这会自我强化「深层更像人脑」的结论。要真排除它,得用更贴近猕猴视觉经验的刺激集,或者用猕猴的行为去估计视觉世界的差异。

术语

原文与代码

社区讨论

全部论文解读