Evaluation Resolution Confounds Learning-Rule Comparisons in Model-Brain RSA of Early Visual Cortex
Nils Leutenegger
q-bio.NC, cs.LG
2026-08-11
小CNN在CIFAR的32px上训练后,对THINGS-fMRI做RSA:未训练相对反向传播的V1差从32px的约0单调升到224px的0.044。效应约九成来自高于训练分辨率的图像细节,不是池化格点数。
NeuroAI 里一个反复出现的比较是:反向传播、反馈对齐(feedback alignment)、预测编码(predictive coding)、STDP 这类学习规则,谁训出来的卷积网络更像大脑视觉皮层。比较工具是表征相似性分析(RSA):把模型各层对一组图片的激活做成表征相异矩阵,再和人/猴视觉区的相异矩阵做 Spearman 相关。
生物合理规则扩不到 ImageNet 规模,所以这类研究通常在 CIFAR 的 32×32 上训小网络,再拿去对自然图像脑数据做对齐,刺激建模分辨率往往是 224px。此前多篇报告、包括作者自己的前期工作,都看到随机初始化网络在 V1 上能追平甚至超过反向传播。这篇把它拆开:这个结果高度依赖很少被当成变量的评估分辨率。
同一套三层卷积小网络(Conv1–Conv3,每块 3×3 加 BN、ReLU、2×2 max-pool,通道 32/64/128,再接 512 维全连接和 10 类头),在 CIFAR-10 的 8000 张 32×32 子集上训 40 个 epoch,5 个种子。五个条件:随机未训练、反向传播、反馈对齐、预测编码、STDP。脑数据主表是 THINGS-fMRI 的 720 张物体图、3 名被试、V1/V2/LOC/IT 的 RDM;猕猴侧用 Brain-Score 上的 FreemanZiemba2013(V1/V2)和 MajajHong2015(V4/IT),单种子。主映射固定为 Conv1→V1。
关键操作是分辨率扫描:网络、权重、归一化都冻住,只把脑刺激双线性缩放到 32/64/96/128/160/224 六档再提特征。为了把「池化位置变多」和「图像细节变多」拆开,另做一条对照臂:先把图压到 32px 再上采样到评估分辨率,内容封顶、位置数照涨。另用 224px 训练的 ImageNet ResNet-50 和 Swin-Tiny 做跨架构扫描;2×2 校准只改 BN 统计,卷积权重保持 bit 相同。
V1 上的规则排名跟着评估分辨率走。所有训练过的条件都在 32px 训练分辨率附近对齐最好,分辨率升高就掉:
| 条件 | 32px ρ | 224px ρ |
| 未训练 | 0.065 | 0.076 |
| 反向传播 | 0.065 | 0.031 |
| 反馈对齐 | 0.020 | 0.012 |
| 预测编码 | 0.026 | 0.016 |
| STDP | 0.059 | 0.037 |
未训练相对反向传播的 V1 差,从 32px 的 −0.001±0.007(5 种子里 3 个为正,不显著)单调涨到 224px 的 +0.044±0.006(5/5 为正)。改成每档选对 V1 最好的层,差从 +0.014 涨到 +0.060,增长形态不变。「在训练分辨率上差约为 0」只属于固定 Conv1 映射。
四条候选机制都被排除。把未训练网络的 BN 统计在评估分辨率上校准,卷积权重保持 bit 相同,224px 上相对反向传播仍有 +0.041(CIFAR 校准)或 +0.033(THINGS 校准)。ImageNet 上 224px 训练的 ResNet-50(0.045→0.033)和 Swin-Tiny(0.080→0.052)同样在低分辨率最好,所以不是「评估偏离训练分辨率被罚」。Gabor 滤波器组自身对 V1 只有 ρ≈0.018–0.037;ResNet-50 早期层比未训练 CNN 更像 Gabor 约十倍,V1 对齐却更差。全局亮度标量对 V1 RDM 能到 ρ=0.075,几乎贴上未训练网络的 0.076,偏掉亮度后未训练对齐腰斩(0.076→0.038);亮度相似度和 V1 斜率虽然一起排序,并不承载效应:CIFAR 评估分辨率校准让亮度相似度下降、V1 对齐上升。
第五个实验把效应钉在内容轴上。内容封顶在 32px、池化位置从 1024 涨到 12544(12 倍)时,未训练相对反向传播的差只再开 +0.003±0.001,原生臂同期开 +0.030±0.002;反向传播的下滑被取消(−0.023→−0.000)。大约 90% 的分辨率依赖来自高于训练分辨率的图像细节,不是平均了多少个位置。
训练轨迹同样被分辨率改写:224px 评估时反向传播的 V1 对齐从 epoch 0 到 40 掉 −0.031,这就是文献里「训练损害早期视觉对齐」;同一条 run 用 32px 评估,净变化 −0.000。LOC 上反向传播相对未训练在每档都高约 +0.019(32px)和 +0.018(224px),5/5 种子,这条学习效应跨分辨率站住。
另有一处实现勘误:预测编码和 STDP 曾把 eval() 改成空操作,特征提取时 BN 仍在训练模式。修好后 STDP 的平坦分辨率曲线消失,预测编码在 V1 上的退化比反向传播更大,推翻了作者动力学前作的中心结论。随机和反向传播条件不受影响。
做学习规则或架构的早期视觉对齐时,评估分辨率必须当变量报出来,至少要在训练分辨率和常用评估分辨率各跑一档。生物合理规则因为训不大,最容易踩进「小图训练、大图评估」的缺口,于是「未训练或局部规则在 V1 上不输反向传播」这类结论,有相当一部分可能是分析选择的产物。LOC 上反向传播仍稳定领先,说明学习确实改了表征,只是早期视觉被分辨率效应盖住了。
在这套全局平均池化加 Spearman RSA 的比较里,一个标量亮度就能贴上最好模型对 V1 的对齐。这限制的是这种测量能分辨什么,不是模型-脑对齐本身。换拟合读出、保留空间结构,数字可能完全不同。
猕猴分析是单种子,跨种只能当方向性支持。人 fMRI 只有 3 名被试,其中 1 名信号弱,核心统计主要靠另外 2 名。预测编码的 Conv1 权重相对初始化只动了约 2%,Conv3 完全没更新,「跨条件成立」要打折。反馈对齐和 STDP 的初始化方案与另外三个条件不同,未训练基线只对其中三个是严格匹配对照。联合偏掉四个相关的低层参照会把训练条件打到强负,属于过减。所有结果都建立在全局池化特征的秩相关上,丢了空间结构。机制仍空着:为什么 32px 以上的细节帮随机滤波器、伤训练过的滤波器,论文没有给出解释。