符合生物学法则的网络 CIFAR-10 跑到 61.7%:Sakana 把它从 MNIST 拓展到分类与强化学习

Diffusing Blame: Task-Dependent Credit Assignment in Biologically Plausible Dual-Stream Networks

Yutaro Yamada, Luca Grillotti, Rujikorn Charakorn, Sebastian Risi, David Ha, Robert Tjarko Lange

cs.LG, cs.NE

2026-06-30

把每层拆成兴奋/抑制双流、权重全锁非负、用 Error Diffusion 取代反传:这种守 Dale 原则的网络 MNIST 96.7%、CIFAR-10 61.7%,接 PPO 还能打连续控制。

这篇在解决什么

反向传播训练深度网络,要求反向那趟用前向权重的精确转置(weight transport),这在生物学上站不住,真神经元的突触没有这种对称的「权重搬运」。已有的一些「生物合理」学习规则绕开了 weight transport:Feedback Alignment 用固定随机矩阵代替反向权重,Direct Feedback Alignment(DFA)把输出误差直接随机投影到每层。但它们都允许任意正负的权重,违反另一条更硬的生物学约束,Dale 原则,即每个神经元的所有突触要么全兴奋、要么全抑制。

Error Diffusion(ED)是个天然合 Dale 原则的局部学习规则:权重更新只依赖突触前活动、突触后激活导数和一个全局误差信号,不用搬权重也不用随机反馈。问题是它之前只在二分类和 MNIST 上验证过。能不能既严守 Dale 原则、又能在分类和强化学习上都打得动?这就是这篇(Sakana AI)要回答的。

方法

核心是双流(dual-stream)架构:把每一层拆成兴奋(p)和抑制(n)两路。所有四个权重子矩阵元素级非负,跨流连接的负号是结构上硬编码的(兴奋流的输入来自对方抑制流时带负号),这样可学参数全非负,而网络仍能做减法。代价是参数量约 4 倍(同宽度下 32M 对 8M)。

把 ED 从二分类推到多输出,靠的是 modulo error routing:给每个隐藏单元固定分配一个输出通道 r(i)=i mod C,它拿对应那一维的输出误差当学习信号,误差经固定路由矩阵广播到各隐藏单元。这是确定性的、结构化的「单元对应输出」关系,不像 DFA 用随机反馈矩阵。

分类场景另外加了三个针对性设计:逐层 sigmoid 宽度(因为 sigmoid 导数直接门控 ED 误差信号,事后分析发现从输出层到第一个隐藏层误差衰减了 25 倍,把 sigmoid 拉宽能保住导数);batch-centered class error(10 分类用独立 sigmoid 而非 softmax,one-vs-all 的 9:1 失衡会让某类通道被持续压住,所以逐类减去 batch 均值让误差零均值);非对称初始化(兴奋权重 1.5×、抑制 0.5×,初始 E/I 比约 3:1)。强化学习里 ED 接进 PPO,替掉 PPO 隐藏层间的反传,用 ReLU。

结果

分类:完整 ED 在 MNIST 96.7±0.1%、CIFAR-10 61.7±0.7%,比「种子 ED」(无三个创新)的 50.4% 和 11.6% 强一大截。DFA 更高(MNIST 97.6%、CIFAR-10 69.1%),但它违反 Dale 原则、带约 284 万个负权重。ED 与 DFA 的差距从 MNIST 的 0.9 个百分点扩大到 CIFAR-10 的 7.4 个,说明任务越难,守非负约束的代价越大。作者也坦白:62% 的 CIFAR-10 准确率离传统梯度方法还差得远。

消融顺序会翻转,是这篇最扎实的发现。MNIST 上,去掉逐层 sigmoid 宽度是毁灭性的(96.7%→25.3%,掉 71.4 个百分点),去掉 batch-centering 几乎无损(-0.3),对称初始化毫无影响(+0.0)。到了 CIFAR-10,顺序整个反过来:去掉 batch-centering 最致命(61.7%→13.8%,五个种子塌了四个,-47.9),逐层宽度 -15.1,非对称初始化 -5.5。同一个组件,在一个任务上关乎生死,在另一个任务上可以忽略。

强化学习(Brax 的 Ant、HalfCheetah、Humanoid 加 Craftax):ED-PPO 在 HalfCheetah 上最强,5494±691 反超 BP-PPO 的 3520±485(p<0.001),与 DFA-PPO(5581±359)持平;Ant 上与两个 PPO 变体持平;Humanoid 和 Craftax 落后 BP-PPO。Craftax 上还反转了一次:一直被当成反传替代标杆的 DFA-PPO 在这个开放任务上最弱(19.8),反不如 ED-PPO(约 23)。随机反馈这种在监督学习上够用的路子,到复杂 RL 上会塌。

事后分析还有两条:训练把 3:1 的非对称初始化推向接近 1:1 的平衡,而且越深的层越偏抑制(第 1 层 1.03、第 2 层 0.90、第 3 层 0.81),这跟皮层里抑制随深度增强的观察 loosely 对得上;非负下限(1e-4)让 37.3% 的权重压到地板,跨流抑制连接被剪得最狠(最高 68.8%),等于「白送」了结构化稀疏。

为什么重要

对专门做生物合理学习的人,这篇把 ED 从「只能上 MNIST」推进到多分类和 RL,是个实打实的扩展。对更广的从业者,它真正的价值是那个测量学警告:别拿单个 benchmark 下结论说某个架构组件重不重要。MNIST 上无关紧要的 batch-centering,到 CIFAR-10 就是命门。这种随任务翻转的瓶颈,只看一个任务的消融图根本看不见。

它也给类脑、神经形态硬件一个更实在的着力点:权重本身被约束成非负(符号由固定的兴奋或抑制通路决定),对那些物理上天然编码非负量(光子、模拟器件、突触器件)的衬底很友好。

局限与存疑

绝对成绩仍然弱:CIFAR-10 61.7% 跟主流梯度方法差得远,作者自己承认。跟 DFA 的 0.9 到 7.4 个百分点差距,量化了守 Dale 原则的当前代价。ED-PPO 在所有环境上方差都比 BP-PPO 大,Craftax 上比 BP-PPO 低约 4 分(p=0.002),说明 ED 那种粗粒度的模块化信用分配,在需要细粒度时序归因或稳定收敛的任务上不够稳。

4 倍参数开销本身可能就在拖后腿:37.3% 的权重压到地板,有效容量远低于名义参数量。作者分不清这到底是信用分配质量的问题,还是非负约束把容量掐死了。

还有一处存疑:E/I 平衡、路径剪枝这些「涌现」行为,作者在叙述里往生物学方向靠,但权重层面的 E/I 比只是细胞数、放电率、突触强度联合决定的生物 E/I 平衡的间接代理,这个类比别当硬结论。

术语

原文与代码

社区讨论

相关论文

全部论文解读