循环 Transformer 翻案:Loopie 用 1/7 预训练量追上 30B 基线

Loop the Loopies!

Zitian Gao, Yilong Chen, Yihao Xiao, Xinyu Yang, Ran Tao, Joey Zhou, Bryan Dai

cs.CL, cs.AI

2026-07-17

Loopie 把循环 Transformer 的循环改成层级循环(层 1→层 1→层 2→层 2),在等算力下反超堆参数的 vanilla 基线,预训练只用 3.5T token,是 Nemotron 的不到七分之一,数学推理追到 AIME 2024 的 92 分。

这篇在解决什么

循环 Transformer(Looped Transformer)是想用「把同一组层跑 N 遍」来省参数:同一个网络反复执行,理论上参数少但等效算力高。它一直有个心病:跑 N 遍就把预训练算力放大 N 倍,所以该比的对手不是同参数的模型,而是参数量大 N 倍的那个。以前的结果是,循环打不过堆参数,给 N 倍算力,把参数量放大 N 倍通常比把模型跑 N 遍更强。Loopie 要解决的就是这个「循环亏」。

方法

关键改动在循环的粒度。以前的 model-loop 是「层 1→层 2→层 3→层 1→层 2→层 3」整网络重复。Loopie 用 layer-loop:每一层连续跑两遍再进下一层,「层 1→层 1→层 2→层 2→层 3→层 3」。

两个模型:Loopie-20B-A2B(27 层、hidden 2304、128 个专家每 token 激活 8 个、循环 2 次)和 Loopie-6B-A0.6B(18 层、hidden 1536、同样 128 专家 8 激活、循环 2 次)。配方是先把存储层数砍半,再把每层执行两次,省下来的显存拿去把每卡 microbatch 翻倍,把效率再投回容量。循环的算力不是白来的,等算力下要么训更少 token、要么用更小的存储架构、要么去比一个更强的非循环模型,这是论文反复强调的诚实前提。

推理靠一套新后训练叫 SPT(Supervised Pre-Training),把 SFT 的监督形式和预训练的优化规模合起来,单 global batch 跑 1.28 亿 token,是常规 SFT 的约 1000 倍。整条流水线是预训练、高质量退火、SPT(2T token)、数学 RL、Loopie Thinking。

结果

和算力匹配的 vanilla 30B-A3B(都训 800B token)比,Loopie 前期落后,大约 600B token 后反超。四档小模型(0.15B 到 1B 激活参数)的缩放阶梯里,每一档 Loopie 都赢算力匹配的 vanilla,而且差距不随规模消失。循环次数扫描发现循环收益在 R=2 最大,所以全系列只用 2 次循环。

token 效率很能打:Loopie 预训练只用 3.5T token,Nemotron 3 Nano 和 Nemotron Cascade 2 各 25T,Loopie 不到它们的七分之一,但在多数知识和通用能力基准上追平或超过。Loopie-20B-A2B Thinking 的 AIME 2024 拿 92.09、AIME 2025 拿 83.75、MMLU 81.28;6B 版 AIME 2024 也有 80.42。

为什么重要

循环 Transformer 这条路线之前基本被判了「打不过堆参数」的死刑,Loopie 是第一个在等算力下系统性翻盘的工作。对关心训练效率的人,它说明循环结构如果设计对(层级而不是整网络),可以用更少预训练 token 换同等能力。这个结论对算力受限的团队尤其值钱。

局限与存疑

后训练只做了数学和代码推理,科学问答、对话对齐这些没碰。因为算力有限,SPT 这套新后训练方法没做足够全的消融。论文没做推理时计算(inference-time compute)的系统研究。架构上故意只在一个干净受控的底座(Qwen3-30B-A3B)上做循环,没碰近期那些新架构改进。「追平 30B」的对照里,Nemotron 用了 25T token 而 Loopie 用 3.5T,token 口径对上了,但训练数据配方和后训练流程未必可比,这个差距有多大来自循环结构本身,论文没有完全拆开。

术语

原文与代码

社区讨论

相关论文

全部论文解读