DeepSeek CED 与 GLM 的 KV 缓存复用机制解析

社区热议各家模型的 KV 缓存复用架构。YOCO(You Only Cache Once)设计简单:模型前半部分为普通结构,将隐藏状态再投影得到 K/V 后,后半段所有层共享同一份 KV 缓存。DeepSeek 的 CED 与 YOCO 思路类似,应用于 CSA2 层的全局分支,每层各自独立,且只缓存编码器 KV。GLM 5.2 则在保持灵活性的同时,将「按块打分」变为「按 token 打分」,块内共享 block index 以获得性能收益,各家命名与共享方式引发讨论。

2026-09-11 ~ 2026-09-11 · 4 条相关

事件全程(共 3 集)→