Recirculation
Michael C. Mozer, Shoaib Ahmed Siddiqui, Danny Sawyer, Sunny Sanyal, Rosanne Liu
cs.LG
2026-08-19
DeepMind 提出推理期方法 Recirculation:把深层激活按约 15% 权重混入浅层再算一遍,不训权重就让 Gemma3 困惑度降最多 35%,GSM8k 错误率降 21%。
Transformer 是前馈结构:一个 token 的表示从浅层往深层单向流动,状态更新的次数被层数卡死。浅层在处理歧义词时看到的是模糊表示,等深层结合上下文把词义确定下来,这个结论回不到浅层。DeepMind 引了 2025 年一项激活干预实验:处理到歧义词那一格时,把深层的表示复制到浅层再继续跑,语境化错误降了 60%。这说明表示本身是对的,卡在架构够不着。
这种失败在多轮对话里表现为前后口径不一:上文已经把 bank 理解成河岸,下一句被问到「这里能找到 ATM 吗」,模型又滑回金融机构的联想。链式思维(CoT)能缓解,但要消耗生成 token;循环 Transformer(looped transformer)也常被提起,但它靠的是加深,训练成本高。
Recirculation 的做法出乎意料地简单。逐 token 跑模型,每跑完一步,把第 s 层的残差流激活缩放后混进第 d 层(d 浅于 s),再让这一步过第二遍网络栈:
为什么直接混、不用 adapter 或 cross-attention?残差流像一块所有层共用的黑板,同一特征不管在哪一层写入,对输出分布的直接作用相同,各层特征近似 1:1 对齐,深层语义可以被浅层直接读懂。漏 15% 幅度小,不至于把表示推出训练分布。
与 looped transformer 的区别在状态传播方向。循环 Transformer 状态沿深度上移,追踪 t 步状态需要 t 层;Recirculation 的同一层既能持有 z(t) 也能持有 z(t+1),理论上可以无限追踪,代价是 prefill 必须逐 token 串行。生成阶段两遍栈可并行跑,延迟几乎不变。
| 设置 | 基线 | Recirculation | 变化 |
| 困惑度,PG19,Gemma3 12B | 52.86 | 34.15 | -35.4% |
| 困惑度,arXiv,Gemma3 1B | 19.10 | 16.54 | -14.0% |
| 困惑度,十数据集平均,Gemma3 1B | - | - | -8.5%(固定 α) |
| 同上,自适应版 | - | - | -23.0% |
| GSM8k pass@1,Gemma3 4B | 29.3% | 30.6%→35.5%(自适应) | 错误率 -8.8%/-20.9% |
| GSM8k pass@128,同上 | 94.9% | 96.0%→96.5% | 错误率 -20.9% |
| 指令跟随任务,12B 错误率 | - | - | -75% |
十组语言建模数据里九组在各尺度都稳定下降,唯一例外 lambada(序列太短,tokenization 噪声大)。两组对照排掉了廉价解释:单调温度 1.2 只降困惑度 8.48%,Recirculation 单独降 14.21%,两者叠加 19.55%,近可加,说明不是在平滑 softmax;同网格下的免训练 looping 在 Gemma3 上没有稳定收益,热图形态也完全不同,两者作用机制确实不同。
自适应版只训一个 MLP,按 token 输出向量值 α/β,主干权重全程冻结,1B 上平均降 23.0%,已超过全参数微调循环架构的 21.6%。逐 token 分析显示,收益集中在短 lag、中后段位置,副词/形容词/动词受益最大,数词/限定词/代词几乎不变,复数名词受益而单数不变,与「构建持续状态表示」的解释吻合。
免训练改架构这件事能成立,本身就是个信号:预训练模型内部已经留好了改进路径,只是没人问过它。论文把这叫 model-design affordances,类似门把手天然提示「拉」、门板提示「推」。对从业者的直接启示是,循环性不必靠重训获得,先在冻结模型上扫一遍层对,就能知道这个模型族对 recurrence 的胃口,再决定要不要投入训练。
Gemma3 的 Peri-LN 结构可能特别配合,但 Ministral3、Pythia、Qwen3、Phi2 的热图都出现了稳定收益区,只是幅度小得多(约 5% 对不足 0.5%),其他家族没调过归一化和 α,不排除调完也能上去。
论文自己列了六条,最硬的两条:超参(层对和混合系数)依赖领域和任务,找不到任务通用配置或自动映射,实用性就上不去;prefill 要逐 token 串行,长上下文场景可能不可行,分块方案(K 个 token 一组)还没验证。
实测数据也有几处要泼冷水。12B 在语境化问答(Racing Thoughts)上三个题型有两个反而变差;八个单 token 基准上自适应版对训练集高度敏感,在 ARC 上训完其他任务全线下跌,只有用 MMLU 测试集训才全面上涨(注意这有训练测试重叠的星号);其他模型家族收益不足 0.5%,泛化性存疑。作者把这项工作定位成方法论贡献而非可直接上线的技巧,这个自我评估是诚实的。