Kimi Delta Attention 将 KV cache 压低 75% 并提速 6 倍
johnseach · x · 2026-07-27
Kimi Delta Attention 如何支撑百万上下文
这条帖子拆解了 Moonshot/Kimi K3 的长上下文核心:Kimi Delta Attention(KDA) 并不是简单“堆更多参数”,而是用一种更高效的记忆机制来替代传统注意力的 KV cache 膨胀。
- 固定大小记忆:新 token 到来时,不再让它回看全部历史,而是更新一份固定大小的记忆状态。
- Delta 规则:新 key 进入时,先擦掉旧 value,再写入新 value,避免旧记忆互相“糊在一起”。
- 按通道门控:比起每个 head 一个 gate,KDA 给每个 feature channel 单独的遗忘门,控制粒度更细。
- 混合架构:大致是 3 层 KDA + 1 层全注意力,让大部分长序列计算走便宜路线,偶尔用全注意力补回精确全局检索。
帖中给出的结果是:在百万 token 上下文下,KV cache 最多可减少约 75%,解码速度最多可提升约 6 倍,同时在 Moonshot 的内部测试里维持或超过全注意力质量。
所属事件:Kimi K3 公开后焦点转向架构(25 条相关)→
「模型」频道最新
- 第三方实测:DeepSeek V4.1 Flash 达 GPT-6 Astra 98% 分,成本仅 1.4% — ayushtweetshere · 2026-09-11
- TheZhi 发起调查:Fable 5.1 与 Astra 发布后,编码模型选择变了吗 — TheZvi · 2026-09-11
- antirez 谈 Anthropic 禁止未成年人使用 Claude — antirez · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- RTX 3060 全本地语音助手复刻 GPT Live 官方演示,6 分钟跑完全程 — liampetti · 2026-09-11
- 曝 Meta Muse Agent 内置邀请码逻辑,或携额外免费额度上线 — testingcatalog · 2026-09-11