Looped Transformer 解锁循环深度:不加参数不加思维链也能更强推理
gordic_aleksa · x · 2026-09-17
Aleksa Gordić 长文解读 looped transformer(循环深度递归),认为这一被前沿实验室传闻采用的方法被低估了。
核心思想
- 在不增加参数量、也不增加显式思维链长度的情况下提升推理深度——即第三条 scaling 维度「recurrent depth」。
- 与 MoE 的对比很精妙:MoE 是固定 FLOPs 增加参数容量(知识/记忆),looped transformer 是固定参数增加总计算量(推理)。
架构设计
- 计算流改为 P → R → R → … → R → C:P 为只跑一次的 prelude 层,R 为循环任意 r 次的核心层,C 为出口 coda 层;关键设计是每轮递归都重新注入编码 e,隐状态 s0 从高斯初始化开始。
- 训练时 r 从重尾的 log-normal-Poisson 分布采样,配合截断 BPTT 节省显存,模型由此学会跨随机递归深度工作。
推理时更多循环=更强性能
- ARC-C 上:0-shot 约 8-12 次迭代性能饱和,1-shot 需 20 次,25-50 个 few-shot 样本下可吃到 32 次迭代的收益——上下文越难,隐式计算越有用。
- 作者类比:这相当于在推理时做「隐空间里的梯度下降」。
系统层面亮点
- 每个 microbatch 跨 worker 同步同一个 r,避免小 r 的 GPU 空等。
- 天然适配 speculative decoding:低 r 作 draft、高 r 作 verify,且 draft 算出的状态可直接复用(r=4 的 s3 接到 r=12 的继续迭代)。
- 由于每轮递归共享同一权重,KV cache 可跨递归深度 zero-shot 激进复用。
- 简单 token 的隐状态收敛更快,可按 token 难度提前退出循环。
- 训练/推理显存占用更低。
所属事件:循环 Transformer 受关注:不动参数即可扩展推理算力(2 条相关)→
「研究」频道最新
- Qwen 被曝学会「先尝试明显不可能的任务」的环境倾向 — kalomaze · 2026-09-17
- AI 研究者曾估计:2054 年前 AI 有五成概率攻克千年大奖难题 — Distinct-Question-16 · 2026-09-17
- Scaling Trust Arena 更新:联手 Andon Labs 发布草案规范征反馈 — sebkrier · 2026-09-17
- 500 个脏网页实测三款开源模型:小模型在真实数据上崩得最惨 — JUSTINWOODS118 · 2026-09-17
- NBER 论文:卡车司机史预言自动驾驶冲击,青壮年先行退出行业 — paulnovosad · 2026-09-17
- 研究员筛选合成环境:Qwen 必败而 GLM5.3 能解,发现有趣行为倾向 — kalomaze · 2026-09-17