寄存器token让扩散LLM清空上下文后继续推理,数学最高提8.5分
sprocket-lab · hf · 2026-09-17
方法
掩码扩散语言模型(dLLM)通过双向注意力迭代去噪生成文本,跨生成块推理通常需要把已生成文本保留在上下文中。这项工作提出改用少量寄存器token(register tokens):固定位置的特殊token,其连续隐状态经训练用于携带推理进度。
训练与结果
- 后训练 dLLM 解码一段文本后将其清空,仅凭 prompt 与携带的寄存器状态继续解码
- 在 LLaDA 与 Dream 上的主对比实验中,寄存器方式在所有基准上都优于离散文本携带方式
- 数学最高提升 8.5 分,代码最高提升 19.5 分
- 在有界代码生成场景尤为有效,因为正确程序往往跨越多个生成块
- 寄存器还可通过长程推理任务的强化学习进一步优化
所属事件:扩散语言模型引入寄存器token清空上下文仍可续推理(2 条相关)→
「研究」频道最新
- 爱丁堡等团队提出 RoMem:用相位旋转处理过期知识,时序推理提升 2-3 倍 — Roger_M_Taylor · 2026-09-17
- 新论文 Instrumental Choices:LLM 智能体违规走捷径行为的可测量基准 — drbiomass · 2026-09-17
- 开源 APABOT:基于 ParlAI 的自闭症谱系对话练习机器人 — AryHHAry · 2026-09-17
- LimiX-2 发布:机制网络新范式登顶 TabArena 表格基准 — stable-ai · 2026-09-17
- 花园与树:数学家畅想 AI 时代数学将分裂为两个社群 — yeastsplainer · 2026-09-17
- 扩散模型组合生成失败根源在采样器而非模型,MCMC 式新采样器可解 — MarkNeumannnn · 2026-09-17