Generative Recursive Reasoning
Junyeob Baek, Mingyu Jo, Minsu Kim, Mengye Ren, Yoshua Bengio, Sungjin Ahn
cs.AI
2026-05-19
GRAM 把递归推理的隐状态更新改成可学习的随机采样,在数独上以 10M 参数跑到 97%,所有前沿推理大模型都是 0 分。
要让神经网络做「长推理」,目前主流靠自回归地逐 token 展开(Chain-of-Thought)。另一条路是 recursive reasoning model(RRM):不生成中间文字,只在一个连续的隐状态(hidden state)上反复跑同一个转移函数,把「想多久」变成「循环多少次」。代表是 HRM、TRM 和 Looped Transformer。这条路省 token、能按需加深度,但有一个硬伤:确定性。整条隐轨迹被钉死成一条线,不管跑多少次都收敛到同一个答案。
这在两类问题上直接撞墙。一是答案不唯一的问题:N-皇后、图着色、数独都可能有多个合法解,确定性模型只会吐一个,覆盖率天花板很低。二是不确定环境:没法同时保留几个候选假设。作者把这种「只会一条路走到底」称作 mode collapse,和生成模型里常见的那类塌缩是同一回事。论文要做的,就是把递归推理从确定性计算,变成一个真正的概率生成模型。
GRAM 的核心动作很小:在递归转移里加一步可学习的随机扰动。原来的确定性更新先算出一个提案 ut = fH(h, l),GRAM 在它上面叠一个高斯噪声 ε N(μθ(ut), σ²θ(ut)I),最终更新 zt = ut + εt。注意这个噪声不是固定方差的白噪声:均值 μθ 给出「该往哪个方向扰动」的引导,方差 σ²θ 控制「探索多猛」。均值和方差都是网络学出来的、随当前状态变化。
为什么只在高层加随机?GRAM 的隐状态是分层的 z = (h, l):高层 h 每步更新一次,管抽象走向;低层 l 在一步之内被精化 K 次,做细致的约束传播。随机性只作用在高层 h 上,因为要在抽象层面「岔开路」,低层该把约束算准就老老实实算准。这一点在消融里被反复验证。
把随机加进去之后,GRAM 不再是判别器,变成了一个隐变量生成模型:它对 p(y|x) 建模的方式是边缘化掉一整条随机轨迹 τ = (z0 → … → zT)。训练用 amortized variational inference 的 ELBO,有一个推断网络 qφ(τ|x,y) 配合先验 pθ(τ|x),两者都是条件马尔可夫过程。为了训练稳定,梯度只在每个监督步的最后一步回传(truncated propagation),并沿轨迹布 16 个监督点(deep supervision)给密集信号。
这套框架顺带给出两条推理期的扩展轴,而不只是「加深度」那一条:
把输入换成空条件,同一个递归过程还能无条件生成 p(x)。一套架构,既能推理又能生成。
结构化推理(Sudoku-Extreme、ARC-AGI):
| 方法 | 参数量 | Sudoku | ARC-AGI-1 | ARC-AGI-2 |
| Looped TF | 7M | 61.3 | 未报 | 未报 |
| HRM | 27M | 55.0 | 40.3 | 5.0 |
| TRM | 7M | 87.4 | 44.6 | 7.8 |
| GRAM | 10M | 97.0 | 52.0 | 11.1 |
| Gemini 3 Pro | 未报 | 未报 | 75.0 | 31.1 |
GRAM 在三栏里都压过所有确定性递归基线,参数还比 HRM 少近三分之二。有一处对照要专门看:所有前沿推理大模型(o3-mini、GPT 5.2、Grok-4)在 Sudoku-Extreme 上都是 0 分,Gemini 3 Pro 在 ARC-AGI 上有绝对优势,但在数独上同样挂零。这是论文把大模型列成「难度参照」而非「公平基线」的原因:训练数据、推理预算、外部脚手架都对不齐,只说明这个 benchmark 对纯语言推理有多硬。
把推理预算拉到同样水平(N=20 条采样 × 16 步),GRAM 97.0% 仍高于 TRM 的 90.5%;TRM 要追平,得把迭代堆到 320 步。宽度这一轴确实在起作用,而且能并行。
多解任务(N-皇后 8×8、图着色):
| 方法 | N-皇后 8×8 准确率 | 覆盖率 | 图着色 10 顶点 冲突边 ↓ |
| AR | 96.3 | 84.8 | 61.3 |
| MDLM | 96.1 | 87.2 | 12.0 |
| HRM | 78.7 | 26.7 | 未报 |
| TRM | 66.8 | 36.1 | 未报 |
| GRAM | 99.7 | 90.3 | 3.3 |
确定性递归基线的覆盖率天花板卡在 36.1%(TRM),而且解越多掉得越狠,这正是 mode collapse。GRAM 的准确率和覆盖率都稳。图着色更能说明问题:GRAM 把冲突边压到 3.3,AR 还剩 61.3,差了一个量级。论文把这归因于「递归精化让约束传播比纯采样更利」。
无条件生成:TRM 在 MNIST 上彻底 mode collapse,FID 303.29;GRAM 256 步能到 IS 2.04、FID 73.34,和 D3PM(1000 步、最多 55.1M 参数)一个量级。从空网格生成数独,GRAM 跑出 99.05% 合法率,且不需要任何外部约束检查器。
最值钱的一点是它给递归推理补上了「宽度」这条扩展轴。深度扩展(多循环几次)天然串行、涨延迟;宽度扩展(多采几条轨迹)天然并行。这意味着推理算力可以横向铺开,而不是只能纵向堆时间。对一个以「按需加算力」为卖点的推理范式,这是结构性补强。
第二个收获更通用:那步随机引导(stochastic guidance)是即插即用的。消融显示,把它加到 Looped Transformer、HRM、TRM 上,每个架构都涨;而把「随机」换成朴素白噪声或随机初始化,TRM 一点不涨。所以增益来自变分框架本身,不是「加噪声」这个动作。对正在做 latent reasoning 的人来说,这是个低成本的改进项。
第三,它把「会推理」和「会生成」塞进同一套机制。同一个 GRAM 既能解数独,也能从零生成数独;既能做条件预测,也能无条件采样。在 latent reasoning 和世界模型之间,这里给了一条连贯的路。
最后是个反差:10M 参数的小模型在数独上啃下了一票前沿大模型都做不动的题。这当然不能解读成「小模型碾压大模型」,大模型在 ARC-AGI 上仍强得多。它说明的是,有一类强约束的结构化推理,纯靠语言展开不划算,换成连续隐空间里反复精化加概率采样,效率高得多。
作者自己点出的头号问题是训练效率。deep supervision 沿轨迹串行,和 Transformer 的高度并行训练不在一个量级。他们坦承这是把 GRAM 推向更大基础模型的主要障碍。换句话说,这套方法现在更像「在受控 benchmark 上验证架构思想」,离直接拿去训大模型还有距离。
第二个是生成风险。GRAM 能产出「看起来合理但实际不合法」的结果,论文提醒这种东西一旦被下游决策管线当成已验证答案,会出问题。尤其在它擅长的约束满足场景,错的解代价可能很高。
第三,多采样推理会拉高算力和能耗,宽度扩展不是免费的。论文的实验都在受控 benchmark 上,真实或高风险场景需要额外的不确定性校准和领域护栏,这些都没做。
还有一处存疑:和大模型的对照是「难度参照」而非公平比较,这点作者讲清楚了;但 GRAM 在 ARC-AGI-2 上只有 11.1%,和 Gemini 3 Pro 的 31.1% 之间是个不小的绝对差距。GRAM 的领先目前还局限于确定性递归基线之间的较量,在更开放、约束更弱的抽象推理上,离前沿通用模型仍有距离。