不改权重把循环接回 Transformer:DeepMind 的 Recirculation 让 Gemma3 困惑度最多降 35%

Recirculation

Michael C. Mozer, Shoaib Ahmed Siddiqui, Danny Sawyer, Sunny Sanyal, Rosanne Liu

cs.LG

2026-08-19

DeepMind 提出推理期方法 Recirculation:把深层激活按约 15% 权重混入浅层再算一遍,不训权重就让 Gemma3 困惑度降最多 35%,GSM8k 错误率降 21%。

这篇在解决什么

Transformer 是前馈结构:一个 token 的表示从浅层往深层单向流动,状态更新的次数被层数卡死。浅层在处理歧义词时看到的是模糊表示,等深层结合上下文把词义确定下来,这个结论回不到浅层。DeepMind 引了 2025 年一项激活干预实验:处理到歧义词那一格时,把深层的表示复制到浅层再继续跑,语境化错误降了 60%。这说明表示本身是对的,卡在架构够不着。

这种失败在多轮对话里表现为前后口径不一:上文已经把 bank 理解成河岸,下一句被问到「这里能找到 ATM 吗」,模型又滑回金融机构的联想。链式思维(CoT)能缓解,但要消耗生成 token;循环 Transformer(looped transformer)也常被提起,但它靠的是加深,训练成本高。

方法

Recirculation 的做法出乎意料地简单。逐 token 跑模型,每跑完一步,把第 s 层的残差流激活缩放后混进第 d 层(d 浅于 s),再让这一步过第二遍网络栈:

为什么直接混、不用 adapter 或 cross-attention?残差流像一块所有层共用的黑板,同一特征不管在哪一层写入,对输出分布的直接作用相同,各层特征近似 1:1 对齐,深层语义可以被浅层直接读懂。漏 15% 幅度小,不至于把表示推出训练分布。

与 looped transformer 的区别在状态传播方向。循环 Transformer 状态沿深度上移,追踪 t 步状态需要 t 层;Recirculation 的同一层既能持有 z(t) 也能持有 z(t+1),理论上可以无限追踪,代价是 prefill 必须逐 token 串行。生成阶段两遍栈可并行跑,延迟几乎不变。

结果

设置基线Recirculation变化
困惑度,PG19,Gemma3 12B52.8634.15-35.4%
困惑度,arXiv,Gemma3 1B19.1016.54-14.0%
困惑度,十数据集平均,Gemma3 1B---8.5%(固定 α)
同上,自适应版---23.0%
GSM8k pass@1,Gemma3 4B29.3%30.6%→35.5%(自适应)错误率 -8.8%/-20.9%
GSM8k pass@128,同上94.9%96.0%→96.5%错误率 -20.9%
指令跟随任务,12B 错误率---75%

十组语言建模数据里九组在各尺度都稳定下降,唯一例外 lambada(序列太短,tokenization 噪声大)。两组对照排掉了廉价解释:单调温度 1.2 只降困惑度 8.48%,Recirculation 单独降 14.21%,两者叠加 19.55%,近可加,说明不是在平滑 softmax;同网格下的免训练 looping 在 Gemma3 上没有稳定收益,热图形态也完全不同,两者作用机制确实不同。

自适应版只训一个 MLP,按 token 输出向量值 α/β,主干权重全程冻结,1B 上平均降 23.0%,已超过全参数微调循环架构的 21.6%。逐 token 分析显示,收益集中在短 lag、中后段位置,副词/形容词/动词受益最大,数词/限定词/代词几乎不变,复数名词受益而单数不变,与「构建持续状态表示」的解释吻合。

为什么重要

免训练改架构这件事能成立,本身就是个信号:预训练模型内部已经留好了改进路径,只是没人问过它。论文把这叫 model-design affordances,类似门把手天然提示「拉」、门板提示「推」。对从业者的直接启示是,循环性不必靠重训获得,先在冻结模型上扫一遍层对,就能知道这个模型族对 recurrence 的胃口,再决定要不要投入训练。

Gemma3 的 Peri-LN 结构可能特别配合,但 Ministral3、Pythia、Qwen3、Phi2 的热图都出现了稳定收益区,只是幅度小得多(约 5% 对不足 0.5%),其他家族没调过归一化和 α,不排除调完也能上去。

局限与存疑

论文自己列了六条,最硬的两条:超参(层对和混合系数)依赖领域和任务,找不到任务通用配置或自动映射,实用性就上不去;prefill 要逐 token 串行,长上下文场景可能不可行,分块方案(K 个 token 一组)还没验证。

实测数据也有几处要泼冷水。12B 在语境化问答(Racing Thoughts)上三个题型有两个反而变差;八个单 token 基准上自适应版对训练集高度敏感,在 ARC 上训完其他任务全线下跌,只有用 MMLU 测试集训才全面上涨(注意这有训练测试重叠的星号);其他模型家族收益不足 0.5%,泛化性存疑。作者把这项工作定位成方法论贡献而非可直接上线的技巧,这个自我评估是诚实的。

术语

原文与代码

社区讨论

相关论文

全部论文解读