免费 pause token 把 1B 预训练损失压低 0.028 nat,推理几乎零开销

Free Pause Tokens

John Langford, Nathan Godey, Giovanni Monea, Yoav Artzi, Harry Dong, Ying Fan, Gustavo de Rosa, Zheng Zhan

cs.LG, cs.AI

2026-09-03

在共享骨干上加一条不写 KV 的预测流,1B 模型 iso-token 交叉熵从 2.8957 降到 2.8673;尾段切入只需 1.33 倍墙钟,推理不加上下文、缓存或步数。

这篇在解决什么

Decoder Transformer 每个位置只有一个 hidden state。那个向量既要给后面位置当 KV 摘要,又要当下一 token 的预测器。两件事方向不一致,硬挤在同一个表示里。

State–prediction separation(SPS,状态–预测分离)把前向拆成状态流和预测流,共享骨干,损失只落在预测流上。有效,但预测流要再跑一遍整网,预训练 FLOPs 大约 1.9 倍;灵活 attention mask 还跑不动 FlashAttention,墙钟比 FLOP 比更差。架构改进如果把训练成本翻倍,用旧架构把那些 FLOPs 拿去多训 token,往往更划算。

方法

这篇把分离推到极限:预测流完全不写 key/value,骑在已有位置上,叫 free pause token。每层预测流从同一个学到的 embedding 起步,对状态流的 KV 做 query,再进 LM head。序列不增加位置,推理不加上下文长度、不加 KV cache、不加 decode 步数。多出来的参数就是那一个 pause embedding。

训练成本用四件事压下来:

实验是 1B decoder:24 层、hidden 1536、GQA 16/8、多数层滑动窗口 2048、序列 8192。数据来自 Phi-4 衍生语料,全局 batch 524,288 token,8×B200,Muon 系优化器。对照是去掉预测流、优化器和数据顺序都对齐的同一套模型。

结果

Iso-token、100B 冷却后:

安排100B CE墙钟相对满 pause
对照(无 pause)2.89571.00×-
全程 pause(w=0)2.86731.57×-
42.5% 起切2.86911.33×收回 94%
75% 起切2.87561.14×收回 71%

全程 pause 相对对照少 0.0284 nat,大约 2–3 centinat。切换点没有 loss spike。收益大部分在打开后约 15B token 内到位。

把对照用省下的 node-hour 继续训:75% 切入相对等墙钟对照领先 0.013 nat,42.5% 切入领先 0.012,全程 pause 只领先 0.005。最便宜的日程在等算力下赢最多。更严的 iso-FLOP(约 1.9 倍)里,分阶段仍为正,全程 pause 略负(+0.006)。

下游:DCLM CORE 从对照 0.327 升到全程 pause 的 0.347;climbmix bits-per-byte 从 0.777 降到 0.769。等算力下,100B 的 pause 和 150B 对照打平。Prefill 与标准 Transformer 同价;decode 把两路合成一步,B200 微基准相对标准 decode 大约 1%。

为什么重要

这是一次 iso-parameter、iso-token、且在墙钟口径下 iso-compute 的损失改进,推理侧几乎白给。对已经训到尾声的 1B 级 run,从 checkpoint 切 25% 的 pause 尾段,1.14 倍墙钟就能收回七成收益。它吃的是 decode 步内本来就闲着的并行算力,和投机解码抢的是同一块余量,用途是预测质量不是速度。

数字本身是渐进的。2–3 centinat 在预训练里值钱,因为它会写进 base、被所有后训继承。它不是换架构级别的跳跃,也只在 1B 上见到。

局限与存疑

作者写明:单尺度 1B、主实验单 seed。严格按 FLOPs 而不是墙钟来比,全程 pause 会被多训 token 的对照追上并略超。Shared FFN 为了塞更大 micro-batch 换了更小的全局 batch,对照自己就差约 0.011 nat,共享的真实 iso-batch 代价比表上小,但仍是质量换吞吐。单任务 lm-eval 分数都在 95% 区间内,下游信号只在聚合指标上站得住。没和 multi-token prediction 做过组合。Pause embedding 学到的方向偏向高频续写(逗号、句号、the、and),机制解释还薄。

术语

原文与代码

社区讨论

相关论文

全部论文解读