GLM 5.2 的 KV 缓存共享模式有何巧思

stochasticchasm · x · 2026-09-11

开发者在解读 GLM 5.2 时讨论了其 KV 缓存的共享模式:在保持灵活性的同时获得性能收益,本质上是把「按块打分」变为「按 token 打分」,块内共享 block indices 而不共享 token indices。作者猜测这种设计被引入到后训练阶段,可能与更长的序列有关,但认为 64k 在预训练阶段已经算比较长了。他还提到这种模式命名方式便于讨论,但希望自己起更直观的名字。

所属事件:DeepSeek CED 与 GLM 的 KV 缓存复用机制解析(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →