自然图像上十个模型 r 均值 0.67,控神经元掉到 0.45

2026-10-10

10 个视觉模型沿编码轴合成 27500 张图,回测 5 只猕猴的 25 个位点。自然图像相关 0.67 几乎打平,控制相关掉到 0.45,只有两个对抗训练模型还稳。

这篇在解决什么

视觉编码的榜单已经挤在一起。Brain-Score 和大规模 fMRI 基准上,架构和训练目标差很远的网络,预测视觉皮层可以差不多准。一个很强的推论跟着出现:它们收敛到了同一套和大脑对齐的自然图像参数化。

这个推论靠的是观测性回归。自然图像里像素和物体共变得很密,很多套差别很大的特征都能把同一批发放拟合到接近的相关。这种现象有个名字,Rashomon 效应:同一批观测容得下一大把看起来都对的解释。要知道模型是不是抓住了神经元真正的调谐,得做干预,按模型自己的预测去改输入,看发放跟不跟。

方法

实验是四段闭环。五只猕猴、25 个位点,每只动物五个,覆盖 V3、V4、中央与前部颞下皮层(cIT、aIT)以及颞上沟(STS)。两个 IT 动物用慢性阵列,另外三只用 Neuropixels。位点按校准可靠性挑选,和已选位点的调谐相关超过 0.9 就换掉。校准噪声天花板平均 r=0.88。

校准集 969 张:NSD 自然场景 649、白底物体 259、功能定位图 61。774 张用来拟合,195 张用来选层和报编码分。

十个模型尽量共享骨干,方便把差别归因到训练压力。卷积:ResNet50、语言对比的 ResNet50-CLIP、自监督的 ResNet50-DINO、SEER 训练的 RegNetY-640。Transformer:带 register 的 DINOv2(ViT-B/14)、SigLIP2(ViT-B/16)、蒸馏了多家基础模型的 RADIO v2.5-B。对抗训练两条:ResNet50-Robust,以及 CLIP 的对抗微调 CLIPAG(ViT-B/32)。第十个是 BrainScore 接口里当时 V1 榜首的 AlexNet 权重,和正常训练的 AlexNet 几乎对不上,分类也停在未训练水平,这里当未训练基线。

每个位点、每个模型单独做编码。层激活压到 750 个主成分,岭回归,按验证集 R² 选层。得到的权重向量就是编码轴。沿着这个方向走,模型预测该位点的发放会升高或降低。主成分和岭回归都是线性的,从像素到预测发放整条链路可微。

刺激用轴对齐的特征增强生成。编码轴像一把尺子。从种子图出发,在傅里叶域里做梯度更新,惩罚高频,加上随机裁剪和噪声,把预测发放推到 11 个档,从该位点自然图反应区间下方 25% 到上方 50%。正则按模型-位点自动选,不手调。10 张种子、25 个位点、10 个模型、11 个档,共 27500 张。5% 容差下 94.5% 打到目标档。图再送回同一批位点。

控制好不好看两个数。预测和实测的 Pearson r,以及实测对预测的线性斜率。斜率等于 1,表示档位和发放对上了。

结果

自然图像上,十个模型平均验证 r=0.67,模型均值的标准差 0.07。九个训练模型的标准差只有 0.01,r 落在 0.67 到 0.71。未训练基线是 0.47。分得出有没有训练,分不出头部模型。

换上各自的增强图,平均控制 r 掉到 0.45,模型均值标准差 0.15,250 个模型-位点对的标准差 0.27。重复测量方差分析 F(9, 216)=25.5,p=1.4e-29。五个脑区分开做都显著。排名的跨区 Spearman 相关平均 0.69,aIT 对 cIT 是 0.94。

前部 IT 配 ResNet50,落差最清楚。校准 r=0.87,隔几天重测留出自然图 r=0.95;沿它自己的轴,控制 r=0.28,斜率 0.05,扫描近乎平的。这些图重复呈现的噪声天花板是 0.50,记录噪声解释不了。另一头,CLIPAG 在一个 V3/V4 位点做到 r=0.91、斜率 0.81。25 个位点的平均控制 r 从 0.09 到 0.74。

拉开差距的是 ResNet50-Robust 和 CLIPAG。卷积对 Transformer、自监督对监督、语言对齐对纯视觉,都分不开控制成绩。把 ResNet50 和它的对抗训练版做成预测相反的争议图,只有对抗版解释到额外的、和发放对齐的方差。

对抗敏感度撑不起榜单内部的差别。全体模型上,敏感度与控制斜率的 site-level 相关是 -0.51,越敏感控制越差,模型级 0.89。拿掉两个对抗模型,site-level 掉到 0.05,模型级 0.41,置换 p=0.36。更稳的是输入梯度的频谱集中度:反传到像素后,能量是集中在物体轮廓这类低频结构上,还是铺成高频噪声。全体模型 site-level r=0.64,模型级 0.90;拿掉对抗模型后 site-level 仍有 0.26(p=0.0006),模型级 0.93(p=0.0016)。这个量不用合成图,实验前就能算。留到没见过的模型、位点和动物,R² 大约 0.42 到 0.45。

比较指标结果
自然图像编码十模型平均 r0.67±0.07;九个训练模型 SD=0.01
未训练基线编码 r0.47
增强图上的控制平均 r0.45±0.15;250 对 SD=0.27
模型间差异重复测量 ANOVAF(9,216)=25.5,p=1.4e-29
aIT × ResNet50自然图 / 控制验证 0.87,重测 0.95;控制 r=0.28,斜率 0.05
V3/V4 × CLIPAG控制r=0.91,斜率 0.81
去掉两个对抗模型频谱集中度 vs 敏感度site-level r=0.26 vs 0.05

个性化的 110 张图,也就是每个模型-位点沿自己的轴合成的那一套,把模型分开的标准差是 0.11。每只猴子 5500 张增强图池成一个大榜,标准差缩到 0.04;再去掉各模型自己的图,缩到 0.02。池化之后对抗模型仍略高,平均 r 是 0.48 对 0.40,配对 t(24)=5.3,p=2e-5。即使把它们生成的图全部拿掉,这两个模型仍然排在前面。

和自然图比,从 5 万张 ImageNet 验证图里,为每一对模型挑出预测分歧最大的 220 张。一个前部 IT 例子上,ResNet50 对 ResNet50-Robust 的平均分歧是 0.60 个标准化单位,对应的增强图是 1.30,大约 2.1 倍。1125 个通道-模型对里,90.5% 是增强图分歧更大。25 个位点里 24 个如此,Wilcoxon p=1.2e-7。

为什么重要

自然图像上的线性读出已经分不开头部网络。可用的考法换成:模型指定一条轴,神经元跟不跟。实验前就能预筛,看编码轴反传到像素后频谱集不集中。对抗训练是目前造出这种结构最有效的办法,鲁棒性本身却不是常规模型之间的连续预测因子。

一条自然图上 r=0.87 的轴,拿去推发放可以是平的。做特征可视化、闭环刺激或神经假体,优先试对抗训练过的骨干,或梯度频谱更集中的模型。BrainScore 上那个未训练 AlexNet 登上过 V1 榜首,说明榜单吃的是线性读出能榨出的方差,检查点有没有真训练过要另核。新架构在自然图像上再涨零点几个相关,不一定代表调谐更准。

局限与存疑

报出的编码分是选层之后的验证分,不是另一套没参与选择的图。控制隔了 4 到 8 天,自然图跨会话重测掉到 0.51 到 0.54。各模型在重测上仍然挤在这一段,控制成绩却散开,所以排名不太像会话漂移单独造成的。绝对相关掉了多少来自隔天,没有拆开。

频谱留一预测的 R² 只有 0.42 到 0.45。论文写明,梯度更干净不一定是控制生效的机制,可能只是还没拆开的层级对齐的代理。只测了沿轴方向,轴外那些「模型认为不该响应」的方向有没有真的安静,没有回答。25 个位点、五只动物,两个 IT 植入对着 fMRI 面孔斑块,外推到整条腹侧通路要打折。

压高频和图像增强会不会偏袒某一类模型,没有同一条轴、两套合成器的消融。论文的反驳是:对抗模型在别人生成的图上仍然更准,而这套正则本来是为了让不鲁棒模型做出看得见的变化。互联网规模的搜图也许能缩小差距,这篇只比到 5 万张 ImageNet 里的最优子集。

术语

原文与代码

社区讨论

全部论文解读