DeepSeek CED 与 GLM 的 KV 缓存复用到底差在哪?一条推文讲清架构细节
stochasticchasm · x · 2026-09-11
- 推主 stochasticchasm 觉得各家对 KV 缓存复用模式的命名分类有点好笑,但也承认给模式起名比每次重复描述共享方式更方便;好奇如何命名『复用索引但不复用 KV』这类模式(如 GLM 5.2 的做法)。
- 在后续回复中详细展开 DeepSeek 的 CED:做法本质类似,但只应用于 CSA2 层的全局分支,且每层独立。解码器中每个 CSA2 层同时有全局分支和局部 SWA 分支——SWA 分支由当前层 hidden states 计算,全局分支的 KV cache 只是 encoder hidden states 的线性投影,而且 prefill 阶段不做这一处理。
- 对关注长上下文推理优化、KV cache 内存经济的人来说是有信息量的架构细节对比。
所属事件:YOCO 架构拆解:后半段所有层共享一份 KV 缓存(4 条相关)→
「研究」频道最新
- 告别偏差-方差权衡?过参数化机器学习理论综述 — udmrzn · 2026-09-11
- OpenAI 构造湍流解证明 Navier-Stokes 有限时间爆破,GPT-6 辅以 Lean 验证 — burny_tech · 2026-09-11
- TDDN 融合 DINOv3 与 CleanDIFT,密集预测精度超 CLIP 三倍 — udmrzn · 2026-09-11
- 研究者给果蝇「电极通脑」强制刷 FlyTok:制造最快乐的苍蝇 — DynamicWebPaige · 2026-09-11
- NeurIPS 2026 向全体作者发偏好表,自选三地演讲地点 — NeurIPSConf · 2026-09-11
- 又一个模型转向 Muon:行业观察称其正成为训练默认优化器 — stochasticchasm · 2026-09-11