扩散语言模型引入寄存器 token,清空生成历史仍能延续推理
charles_irl · x · 2026-09-17
研究者为扩散式 LLM(diffusion LLM)提出了「寄存器(registers)」机制:模型在生成文本时可以写入和读取专门的 register token。其关键作用是,即使清空模型的生成历史,模型也能借助寄存器中保存的信息继续推理,为 dLLM 的长程推理与状态保持提供了一种新思路。作者还发布了推文串进一步展开细节。
所属事件:扩散语言模型引入寄存器token清空上下文仍可续推理(2 条相关)→
「研究」频道最新
- JHU 新研究:单目人类视频重建铰接物体并让机器人复现操作 — mangahomanga · 2026-09-17
- Nature 论文 Paper2Agent:把研究论文自动转成 AI Agent — krishnan · 2026-09-17
- Parnet 冻结嵌入零微调,媲甚至超越大型基因组语言模型 — anshulkundaje · 2026-09-17
- 25 位菲尔兹奖得主联署:警惕把'解题数'当成 AI 进步标准 — krishnan · 2026-09-17
- 基于 CLIP-seq 数据的 RNA 基础模型 PARNET 论文发布 — anshulkundaje · 2026-09-17
- 让三大模型写医生简介,竟都产出同一个虚构的 Dr. Elena — dejanseo · 2026-09-17