微软新论文:免费 pause token 让模型白赚推理算力且不加上下文
SonglinYang4 · x · 2026-09-16
dairai 推荐微软与康奈尔的新论文:如果觉得 thinking token 太占上下文,可以看看这个思路。
- 核心机制:pause token 为模型在下一次 token 预测时「白买」额外算力,代价是一个序列位置;免费 pause token 则在共享权重的并行预测流上提供同等算力,借用已有位置而不新增位置。
- 推理收益:不增加上下文长度,KV cache 不变,几乎无额外延迟(额外 FLOPs 不是吞吐瓶颈)。
- 效果:在 1B 模型上 next-token prediction 提升约 2-3 个百分点。
- XLNet 作者任程(原 Google)吐槽:大家总在重复发明 XLNet 里的老想法,原论文为 2019 年 arXiv 1906.08237。
「研究」频道最新
- 研究者证明:能长时程行动的智能体必然内建世界模型与自我模型 — chris_j_paxton · 2026-09-16
- 陶哲轩博客刊文:AI 时代数学该「快数学」还是「慢数学」 — littmath · 2026-09-16
- 繁体中文视觉基准 VisTW:你的 VLM 读得懂台湾街景和考卷吗 — piske_usagi · 2026-09-16
- Mind2Dialogue:模拟用户心理状态训练「懂人」的语言模型 — Zixuan Wang · 2026-09-16
- NUS 综述:基础模型正重塑游戏全生命周期的六大 AI 角色 — NationalUniversityofSingapore · 2026-09-16
- DCO 研究:微调的关键不在改多少而在往哪个方向改 — Fei Yuan · 2026-09-16