DeepSeek CED 与 GLM 的 KV 缓存复用机制解析
社区热议各家模型的 KV 缓存复用架构。YOCO(You Only Cache Once)设计简单:模型前半部分为普通结构,将隐藏状态再投影得到 K/V 后,后半段所有层共享同一份 KV 缓存。DeepSeek 的 CED 与 YOCO 思路类似,应用于 CSA2 层的全局分支,每层各自独立,且只缓存编码器 KV。GLM 5.2 则在保持灵活性的同时,将「按块打分」变为「按 token 打分」,块内共享 block index 以获得性能收益,各家命名与共享方式引发讨论。
2026-09-11 ~ 2026-09-11 · 4 条相关
- 第 1 集:DeepSeek V4.1 Flash 架构解析:YOCO 灵魂与 KV 缓存复用(2026-09-10,7 条)
- 第 2 集:DeepSeek V4.1 Flash 架构解析:非对称设计与省成本机制(2026-09-11,2 条)
- 第 3 集:DeepSeek CED 与 GLM 的 KV 缓存复用机制解析(2026-09-11,4 条)
- YOCO 架构拆解:模型后半段所有层共享同一份 KV 缓存 — stochasticchasm · 2026-09-11
- 拆解 DeepSeek CED:YOCO 式全局分支只缓存编码器 KV — stochasticchasm · 2026-09-11
- DeepSeek CED 与 GLM 的 KV 缓存复用到底差在哪?一条推文讲清架构细节 — stochasticchasm · 2026-09-11
- GLM 5.2 的 KV 缓存共享模式有何巧思 — stochasticchasm · 2026-09-11