扩散语言模型引入寄存器token清空上下文仍可续推理

研究者为扩散式 LLM 提出「寄存器(registers)」机制:模型生成文本时可写入和读取专门的 register token。掩码扩散语言模型通过双向注意力迭代去噪生成文本,跨生成块推理通常需把已生成文本保留在上下文中,而改用少量寄存器 token 后,即使清空生成历史,模型仍能延续推理,数学任务最高提升 8.5 分。

2026-09-17 ~ 2026-09-17 · 2 条相关