Reasoning with Neural Cellular Automata
Mayalen Etcheverry, Pietro Miotti, Aidan Sirbu, Konstantin Schürholt, Mariia Drozdova, Arna Ghosh, Blaise Agüera y Arcas, James Manyika, Blake Richards, Eyvind Niklasson
cs.LG, cs.AI, cs.MA, nlin.CG
2026-09-29
Google 用只见 3×3 邻居的细胞自动机解迷宫、数独与 ARC-AGI-1:201×201 迷宫 100% 解出,算力省 44 倍。
从 looped Transformer 到 TRM、LoopViT 这类循环视觉推理模型,主流推理架构都默认两件事:单元之间全局连接,更新全局同步。这推高了数据搬运和能耗,也把模型绑死在集中式硬件上。Google 的 Paradigms of Intelligence 团队问了个更根本的问题:如果每个计算单元只能看到自己 3×3 的邻居、更新还不同步,还能做需要多步推导的推理吗?此前 NCA 在 ARC 上只有逐任务训练、子集 12.9% 的记录。这篇把严格局部架构放到大迷宫、数独、ARC-AGI-1 和像素级数独上系统验证,答案基本是能。
NCA(Neural Cellular Automata,神经细胞自动机)把 H×W 网格当成计算机。每个格子上的细胞持一个 C 维状态向量,切成几段:不可变的输入段存题面(迷宫里横跨所有通道、挡住信息穿墙,数独里把已知数字钉死),输出段随时可读出预测,隐藏段承载中间推理,ARC 再加一段可学习的任务嵌入。
每步只有两个操作:感知模块把 3×3 邻居状态压成一个向量,全细胞共享权重的 MLP 产生残差更新;每个更新还要过一道 Bernoulli 触发掩码,所以细胞是异步、随机更新的。同一套权重在空间和时间上完全共享,这是 10K 参数就够用的原因。
三个关键选择:
ARC 训练时给每个细胞加全局时间嵌入,推理时换成各细胞自己的计数器,只在触发时走一格;换任务嵌入,同一个模型会在同一张新图上执行不同变换,这是任务条件下的程序归纳,不是背题。
| 任务 | 基线 | NCA |
| Maze-OOD 201×201 | DeepThink:784K 参数、521.7T FLOPs、74.0% | 10K 参数、11.8T FLOPs、100% |
| Maze-Hard | PTRM:7M 参数、382.2T FLOPs、86.7% | 41K 参数、2.0T FLOPs、89.2% |
| Sudoku-OOD | AKOrN:89.5%(97.3T FLOPs) | 98.5%(23.9T) |
| Sudoku-Extreme | PTRM:98.8% | 92.7%,这项落后 |
| ARC-AGI-1 | TRM 44.6%、LoopViT-l 65.8%(均为 pass@2) | pass@2 48.8%,pass@64 60.3%,三模型集成 63.0% |
次级结果同样硬:只在 ≥31 提示的数独上训练,加并行 rollout 能解出 17 提示的盘面;9×9 迷宫只训 3 分钟 TPU,不改权重泛化到 500 倍大的迷宫;置信度高于 0.95 的细胞把触发率降到 0.4,总更新量省 30%,中途被破坏后修复的总计算量降到 0.52×;测试时注入噪声不掉点、反而涨点。像素级的 Visual Sudoku(256×256 手写数独,分类、解题、渲染一体)简单盘 87.8%,难盘 18.9%。
动态层面,迷宫里激活像波前一样并行探路,死路由局部回溯波剪掉;Extreme 数独上细胞先到近似的局部解,再主动加大约束违反逃出去,最后收敛到全局一致,像一场可见的分布式试错。作者称之为「空间 chain-of-thought」。
严格局部性不是推理的障碍,这是全文的核心结论,且带着罕见的效率证据:10K 参数跑满 201×201 迷宫,FLOPs 只有 DeepThink 的 1/44。权重完全共享的架构天然适配低功耗、去中心化、容错的硬件,全局 attention 模型映射不到这种 substrate 上。三轴 test-time scaling 加剪枝,对任何递归推理模型的算力分配都可复用;推理过程就是网格上肉眼可见的动态,可解释性好于黑盒。但要说清楚:Sudoku-Extreme 和 ARC 两项没打赢最强的全局连接基线,作者的定位是可行性证明,不是刷榜。
作者列了三条:训练仍是非局部的,BPTT 要全局损失和误差回传,去中心化只发生在推理;并行 rollout 只是随机搜索,不是主动探索;严格局部性带来信息传播延迟,长程依赖是瓶颈。读下来再补两点:局部性要更多迭代,最大迷宫 D=13000 对 DeepThink 的 2000,延迟敏感场景吃亏;Visual Sudoku 难盘只有 18.9% 且训练吃显存,像素空间推理还是 proof-of-concept。更要紧的是,全部任务都是网格结构谜题,局部性恰好是最合适的归纳偏置;换到没有空间结构的推理(数学、代码)上优势是否还在,论文没碰。