GLM 5.2 的 KV 缓存共享模式有何巧思
stochasticchasm · x · 2026-09-11
开发者在解读 GLM 5.2 时讨论了其 KV 缓存的共享模式:在保持灵活性的同时获得性能收益,本质上是把「按块打分」变为「按 token 打分」,块内共享 block indices 而不共享 token indices。作者猜测这种设计被引入到后训练阶段,可能与更长的序列有关,但认为 64k 在预训练阶段已经算比较长了。他还提到这种模式命名方式便于讨论,但希望自己起更直观的名字。
所属事件:DeepSeek CED 与 GLM 的 KV 缓存复用机制解析(4 条相关)→
「模型」频道最新
- 观察:v4 训练无失稳,1M 上下文撑约 10T token 训练量 — stochasticchasm · 2026-09-11
- Neel Nanda 复现 Astra 系统卡:无思维链推理能力暴涨 1.75 倍 — NeelNanda5 · 2026-09-11
- Artificial Analysis 没被收买:自费 1.3 万美元实测各家模型 — Antblue · 2026-09-11
- 调惯 Claude 检查点的老玩家:回用 Opus 3 才算「回魂」 — repligate · 2026-09-11
- Hume 语音克隆排行榜:最自然的克隆听感仅排第 8 — realmrfakename · 2026-09-11
- CursorBench 4.0 发布:任务更难更长程,各家模型得分集体下降 — StringChaos · 2026-09-11