把对抗样本打进猴脑:IT 神经元并不比对抗训练网络更鲁棒

Adversarially trained neural representations may already be as robust as corresponding biological neural representations

Chong Guo, Michael J. Lee, Guillaume Leclerc, Joel Dapello, Yug Rao, Aleksander Madry, James J. DiCarlo

q-bio.NC, cs.LG

2022-06-19

闭环代理模型把优化出的扰动直接送进猕猴 IT 皮层:生物位点敏感度略高于对抗训练网络,ε=2.5 级扰动即可翻转类别偏好。

这篇在解决什么

灵长类视觉一直被视为稳健感知的黄金标准,业内长期默认:让人工网络模仿大脑的神经表征,就能换来对抗鲁棒性。这个默认此前没法直接检验,因为找对抗样本靠梯度优化,没法对着一小块活体皮层求导。这篇 MIT 麦戈文脑研究所与 Madry 实验室合作的工作补上了缺的一环:一套直接对猕猴 IT 皮层神经元生成并投递对抗样本的闭环方法,再用它测生物神经元到底有多敏感。

方法

攻击不是直接对大脑求梯度,而是维护一个 IT 的代理模型并逐日迭代。基座是 ℓ₂ ε=2 对抗训练的 ResNet50,取 layer 4.0 特征,经通道因子化的线性映射拟合 21 个 IT 记录位点。第一天用代理模型上的 PGD(100 步)在 1000 张干净 ImageNet 图上生成扰动;之后 6 天里,每天把「干净图 + 扰动图 + 真实神经反应」回灌去微调代理模型,到第 5 天累计约 10 万样本,再生成更强的扰动。图片以 8 度视角呈现 100ms,两枚 99 通道 Utah 阵列记录 IT 放电。随着代理模型变准,ε=1 攻击在真实神经元上实现的扰动幅度从第 1 天到第 5 天涨了 2.7 倍,也显著高于高斯噪声或类间插值这类无模型基线。这一对比解释了以往用随机噪声测生物鲁棒性为什么会系统性低估神经元敏感度。

结果

比较指标是归一化对抗敏感度:扰动引起的反应变化,除以该位点在干净图上的反应标准差。DNN 一侧用白盒 PGD,取 100 次随机初始化、每次 250 步的最大值。

对象结果
原生 ResNet50 单元敏感度超基线波动 10 倍以上
猕猴 IT 位点(n=21)比原生 ResNet50 低约 10 倍,仍显著可攻击
AT-ResNet50 / AT-WideResNet50-4(ε=3)略低于 IT 位点

关键的不对称在于:IT 的测量走代理模型,天生是真实敏感度的下界,后续改进只会把生物一侧的数字抬高。即便按这个偏保守的估计,两个对抗训练网络已经比 IT 位点更不敏感。

类别选择性同样扛不住。平均 ε=4.0±1.6 的扰动就足以把非偏好类别图像的反应拉到与偏好类别持平(偏好类别平均 216±60 Hz);ε=10 时平均反应冲到 310±60 Hz,超过任何自然偏好类别,构成「超刺激」,而且这些超刺激肉眼看上去往往并不属于该位点原本偏好的语义类别。作为尺度参照:ε=1 的扰动人类受试者检出率 51%(随机水平 50%,n=50),幅度小于单个像素从黑到白(ε=1.73)。

为什么重要

「生物视觉更鲁棒」不再是可以直接引用的前提。对抗训练没有复刻大脑表征,却在单位点层面追平了 IT,这让「模仿神经表征换鲁棒性」的路线需要重新给出证据。方法本身是第一套能把优化搜索出的对抗样本送进活体大脑的闭环,对神经科学的价值不亚于对 ML:类别选择性这个 IT 研究的基石概念,在局部扰动下并不稳定。

局限与存疑

样本只有 21 个 IT 位点、单一脑区,外推到整个视觉系统要打折扣。测量的是单位点敏感度,不等于行为层面:论文自己指出,种群层面或下游脑区可能存在未知的纠错机制,猕猴的行为识别未必同样脆弱。白盒与代理攻击的不对称虽然方向上有利结论(生物一侧只会被低估),但两个 AT 网络对 IT 位点的优势是「略低」,量级不悬殊,换更强的攻击器或更多位点,排序仍可能移动。

术语

原文与代码

社区讨论

相关论文

全部论文解读