从 Universal Transformers 到 DeepLoop 的循环 Transformer 脉络
KyeGomezB · x · 2026-07-28
Looped Transformers 论文脉络
这条帖子按时间顺序整理了一组与 Looped Transformers 相关的代表论文,包括:
- Universal Transformers
- MoEUT
- Relaxed Recursive Transformers
- Recurrent Depth Transformers
- Mixture-of-Recursions
- DeepLoop
- Loop the Loopies
配图还区分了两种循环方式:
- layer-loop:每一层内部重复多次再进入下一层;
- model-loop:整个模型堆栈作为一个循环反复执行。
引用的文章指出,让 LLM 变强大致有两条路:一是增加参数规模,二是给模型更多训练/推理计算。Looped Transformer 家族探索的正是后者,通过复用层和循环计算来增强模型能力。被点名的 Universal Transformers 是这一方向的早期代表,强调了更好的泛化与动态停止机制。
「研究」频道最新
- 研究发现 RLVR 主要提升采样效率,并未催生新推理模式 — jxmnop · 2026-07-28
- MazeBench 把迷宫评测做成带摄像头控制的持续学习基准 — xeophon · 2026-07-28
- GitHub 项目演示同态加密下的猫图分类 — jedisct1 · 2026-07-28
- MazeBench 开源 3D 迷宫基准,200+ 房间评测智能体 — patience_cave · 2026-07-28
- MazeBench 用 3D 开放世界测智能体,现有模型只到开局 — patience_cave · 2026-07-28
- TWIML 讨论:未来基础模型可直接从已有权重学习 — samcharrington · 2026-07-28