Two Routes to Scalable Credit Assignment without Weight Symmetry
Daniel Kunin, Aran Nayebi, Javier Sagastuy-Brena, Surya Ganguli, Jonathan M. Bloom, Daniel L. K. Yamins
ICML 2020 Camera Ready Versi
q-bio.NC, cs.LG, cs.NE, stat.ML
2020-02-29
反传依赖瞬时权值转置。这篇把前向/反向权拆开,用正则逼对齐:局部 Information Alignment 在 ImageNet 上把 ResNet-18 从 Weight Mirror 的 63.5% 提到 67.93%(反传 70.06%),非局部 Symmetric Alignment 从 ResNet-18 到 152 追平反传。
反传能在 ImageNet 这种规模上把多层网络训起来,但它要求回传误差的权矩阵恰好是前向权的转置。一个突触要瞬时读到另一个突触的强度,生物学上没有对应机制,这就是 weight transport problem。
绕开它的老路都卡在规模上。Feedback alignment 把反向权固定成随机矩阵,浅网和 MNIST 能跑,深网络加 ImageNet 就崩。Target propagation 让反向权局部反演前向计算,同样过不了 ImageNet。Akrout 等人 2019 年的 Weight Mirror 声称 ResNet-18 能到 69.73%,几乎贴着反传。Stanford 这组按原文设定复现,只拿到 63.5%;用 TPE 搜了 824 组超参,最高 64.07%。把 ResNet-18 的超参直接搬到更深或 v2 结构上,对齐损失会在前一千步变成 NaN。
局部规则不是不能用,是太脆。
做法是把绑死的前向/反向权拆开。前向权 θf 负责任务损失 J,反向权 θb 把误差信号往回传,再加一层只作用在反向权上的正则 R,总损失是 J(θf)+R(θb)。每一步,前向权沿反向权给出的伪梯度走,反向权沿 ∇R 走。R 选对了,两边逐渐对齐,伪梯度就越来越像真梯度。
R 由五个几何上干净的 primitive 线性组合出来,按局部性分成两组。局部三项只看突触两端的活动:decay 惩罚反向权的欧氏范数;amp 让 Bl 重建的 xl+1 去对齐层输入 xl;null 惩罚重建 Bl xl+1 的范数。非局部两项踩了 locality 的红线:sparse 让 Bl 作用在「错方向」的 xl 上;self 直接取 Bl 和 Wl 的内积,等于让反向突触去量前向突触的强度。
这套积木能拼出已有算法,也能拼新的。Feedback alignment 对应 R=0。Weight Mirror 是 amp+decay。新的局部规则 Information Alignment 在 Mirror 上再加 null,动机来自 Oja 对 Hebbian 更新的归一化:纯 Hebbian 的 ∆Bl=η xl xl+1^T 会把范数撑爆,decay 是一种压法,Oja 风格的归一化展开后近似就是 null 项。当 α=γ 且 xl+1=Wl xl 时,IA 等价于二次正则的线性自编码器,Kunin 等人 2019 年证明过这种自编码器的临界点前向/反向权对称。
非局部两条路走得更直接。Symmetric Alignment 用 self+decay,梯度正比于 ‖Wl − Bl^T‖²,推的是权对称;Activation Alignment 用 amp+sparse,推的是激活对齐 ‖Wl xl − Bl^T xl‖²。两者对应的动力学矩阵是半正定的,对称分量的特征值为零,Weight Mirror 那套不定矩阵做不到这一点。
为了把局部规则稳住,还试了 Adam,以及不含可学参数的层内中心化、特征归一化。IA 的超参搜索覆盖了这三件事,一共 628 组设定。
ResNet-18、ImageNet 验证集:
| 方法 | top-1 | top-5 |
| Weight Mirror(按 Akrout 设定) | 63.5% | 85.16% |
| Weight Mirror + TPE | 64.07% | 85.47% |
| Mirror + Adam | 64.40% | 85.53% |
| Mirror + Adam + 局部归一化 | 63.41% | 84.83% |
| Information Alignment | 67.93% | 88.09% |
| 反传 | 70.06% | 89.14% |
Adam 和归一化单独加进去,ResNet-18 精度几乎不动,但跨结构时不再动不动 NaN。IA 在 ResNet-18 上搜到的超参,直接搬到 ResNet-50、50v2、101v2、152v2,精度始终压过其他局部规则,仍低于反传,缺口随深度变大。
非局部两条几乎不用调,就能贴着反传走:
| 模型 | 反传 | SA | AA |
| ResNet-18 | 70.06% | 69.84% | 69.98% |
| ResNet-50 | 76.05% | 76.29% | 75.75% |
| ResNet-50v2 | 77.21% | 77.18% | 76.67% |
| ResNet-101v2 | 78.64% | 78.74% | 78.35% |
| ResNet-152v2 | 79.31% | 79.15% | 78.98% |
SA 不需要 Weight Mirror 那种交替学习模式。AA 对齐得没那么死,最小化 R 时需要 Adam。给反向更新加高斯噪声,SA 比直接给反传梯度加同样噪声更扛。附录里的 Kolen-Pollack 在 ResNet-18/50 上也能贴反传,换到 v2 和更深结构就拉开差距;它虽然用的是局部 primitive,但要求每一步的反向更新恰好是前向更新的转置,生物可疑程度和瞬时权对称差不多。
用 ResNet-18 的表征去拟合猕猴 V4/IT 的时间平均响应,除了几乎没训起来的 feedback alignment,其余够用的规则和反传给出的神经可预测性差不多。成年动物的功能响应,看不出是哪条学习规则训出来的。
给「生物可信的 credit assignment」画了一张可组合的地图,而不是再报一个只在 MNIST 上赢的局部规则。如果只关心 ImageNet 精度,直接用反传。这篇的用处是:想在解耦的前向/反向权上训练,SA 几乎是 drop-in 的,IA 是目前最稳的纯局部选项。
两条路线也说得很干脆。继续打磨局部规则,让它跨结构不再掉点;或者给 SA/AA 这种「权估计」找脉冲级实现。Guerguiev 等人已经在小网络上用回归不连续设计做过近似的 self 项,这篇把 rate-coded 版本推到了 ImageNet 深度网络。
IA 相对反传仍差约 2.1 个点,缺口随深度变大,论文没有给出把局部规则再推平的证据。SA/AA 躲开了「瞬时」转置,但 self 项本身就不满足局部可塑性:反向权要能读到前向权。权估计目前只在 rate code 加高斯噪声这个代理上验证过,深度脉冲网络能不能训起来,文中明确说超出范围。
Weight Mirror 的 69.73% 没复现出来。可能是实现细节,也可能原论文的数字偏乐观,不宜把「Mirror 已经打平反传」当成既成事实。实验几乎全在 ImageNet 和 ResNet 家族上,没有语言、强化学习或其他视觉骨干。成年皮层的表征拟合区分不了学习规则,要用神经科学数据裁决这两条路,得在学习过程中测突触,而不是看训完的 V4/IT。