微软 Cornell 论文:免费 pause token 零推理开销提升模型预测力
dair_ai · x · 2026-09-06
dairai 推荐 Microsoft 与 Cornell 的论文:pause token 机制——通过插入「停顿 token」为每次 next-token prediction 买到额外计算量,代价只是占用一个序列位置。
关键点:
- 免费 pause token 在权重共享的主干上以并行预测流携带同等计算,复用已有位置而非新增位置;
- 推理时几乎零成本:不增加上下文长度、不改变 KV cache、基本无额外延迟(额外 flops 不是吞吐瓶颈);
- 在 1B 模型上,next-token prediction 提升 2-3 个 centinats;
- 成本转移到训练侧:相对优化好的预训练流水线,开销仅约 1.14x,同时保留大部分收益。
对觉得 thinking tokens 的上下文成本承受不起的团队,这是条值得 bookmark 的路线。
「Infra」频道最新
- GPU 编程日更 244 天:作者深挖内存硬件与流水线并行 — blaizedsouza · 2026-09-06
- 独立开发者花六个月做出端侧 Android Agent:行为是可编辑图而非提示词 — alexeyw · 2026-09-06
- 模拟视觉传感器直连模拟加速器:时间编码光子 interposer 论文 — jwt0625 · 2026-09-06
- Conviva 实测:Rust 查询引擎用 io_uring 替换 mmap 反而更慢 — blaizedsouza · 2026-09-06
- DLSS5 视频超分快到离谱,作者提议多遍 x2 放大替代传统 upscale — More-Ad5919 · 2026-09-06
- 别再无视那条 PyTorch 提示:一行设置真能省下大量 flops — generativist · 2026-09-06