扩散语言模型引入寄存器token清空上下文仍可续推理
研究者为扩散式 LLM 提出「寄存器(registers)」机制:模型生成文本时可写入和读取专门的 register token。掩码扩散语言模型通过双向注意力迭代去噪生成文本,跨生成块推理通常需把已生成文本保留在上下文中,而改用少量寄存器 token 后,即使清空生成历史,模型仍能延续推理,数学任务最高提升 8.5 分。
2026-09-17 ~ 2026-09-17 · 2 条相关
- 扩散语言模型引入寄存器 token,清空生成历史仍能延续推理 — charles_irl · 2026-09-17
- 寄存器token让扩散LLM清空上下文后继续推理,数学最高提8.5分 — sprocket-lab · 2026-09-17