Loopie循环Transformer发布,同算力击败30B基线
Zitian Gao团队发布了名为Loopie的循环式Transformer系列模型,旨在通过重复执行网络层来同时提升参数效率与算力效率。该系列包含20B总参(2B激活)和6B总参(0.6B激活)两个MoE版本。据称,在相同的训练墙钟时间与匹配的推理算力预算下,该模型击败了同算力的30B基线模型。
关键细节与突破
过去循环式Transformer在增加预训练计算量时,效果往往不如直接放大参数量。第一作者Zitian Gao表示,团队投入了数亿美元算力去验证经典的Universal Transformer路线(即model-loop方案),发现其难以扩展到上十亿参数的大规模MoE架构。到了预训练后期,团队提出的Layer-loop方案(即Loopie模型)展现出了更卓越的扩展性,克服了以往的痛点。
评估视角的提醒
针对该研究,@teortaxesTex 提醒业界,评估循环式Transformer不能仅仅看参数量。由于重复执行层会放大计算开销,必须在相同的预训练预算和实际训练成本下进行对比才具有参考价值。
2026-07-20 ~ 2026-07-21 · 6 条相关
- 【源头】Loopie循环Transformer发布,同等算力超越传统架构 — Zitian Gao · 2026-07-20
- 【源头】Loopie:更省参数的循环 Transformer — teortaxesTex · 2026-07-20
- Looped Transformer 研究与缩放方案 — teortaxesTex · 2026-07-20
- 【源头】经典 Universal Transformer 验证花了数十亿美元,却难扩展到 MoE — teortaxesTex · 2026-07-21
- Loopie 用循环 MoE 层击败同算力 30B 基线 — burny_tech · 2026-07-21
- 数亿美元算力验证:Layer-loop 比 Model-loop 更适合 MoE 预训练 — teortaxesTex · 2026-07-21