Kimi Delta Attention 将 KV cache 压低 75% 并提速 6 倍
johnseach · x · 2026-07-27
Kimi Delta Attention 如何支撑百万上下文
这条帖子拆解了 Moonshot/Kimi K3 的长上下文核心:Kimi Delta Attention(KDA) 并不是简单“堆更多参数”,而是用一种更高效的记忆机制来替代传统注意力的 KV cache 膨胀。
- 固定大小记忆:新 token 到来时,不再让它回看全部历史,而是更新一份固定大小的记忆状态。
- Delta 规则:新 key 进入时,先擦掉旧 value,再写入新 value,避免旧记忆互相“糊在一起”。
- 按通道门控:比起每个 head 一个 gate,KDA 给每个 feature channel 单独的遗忘门,控制粒度更细。
- 混合架构:大致是 3 层 KDA + 1 层全注意力,让大部分长序列计算走便宜路线,偶尔用全注意力补回精确全局检索。
帖中给出的结果是:在百万 token 上下文下,KV cache 最多可减少约 75%,解码速度最多可提升约 6 倍,同时在 Moonshot 的内部测试里维持或超过全注意力质量。
「模型」频道最新
- Qwen3.6-27B 实测:量化越重,Spec Decode 越赚 — thavoc77 · 2026-07-27
- Kimi K3、GLM-5.2、Qwen 3.8 正面争夺开源权重王座 — johnseach · 2026-07-27
- 曝月之暗面将发布Kimi K3:2.8万亿参数,支持百万上下文 — johnseach · 2026-07-27
- Arena 截图显示 Gemini 3.5 Pro 在两项测试中击败 Opus 5 — Last_Conclusion_8984 · 2026-07-27
- Binance 安卓应用在欧洲部分地区从 Google Play 消失 — RSync25 · 2026-07-27
- Kimi K3 权重公开后,梗图和调侃立刻上线 — uwukko · 2026-07-27