Block Diffusion:扩散语言模型高效复用 KV 缓存
ICLR 2025 Oral 论文 Block Diffusion(arXiv:2503.09573)在自回归与扩散语言模型之间做插值:扩散语言模型虽可并行生成多个 token,但迭代式解掩码反复更新 token 状态,限制了 KV-cache 复用。该方法采用从左到右逐块解码、块内并行的策略,让扩散语言模型也能高效复用 KV 缓存,兼顾并行生成与推理效率。
2026-09-11 ~ 2026-09-11 · 2 条相关
- Block Diffusion 让扩散语言模型也能高效复用 KV-cache — alec_helbling · 2026-09-11
- Block Diffusion 论文:分块扩散兼具并行生成与 KV 缓存 — alec_helbling · 2026-09-11