Kimi K3 用固定 KDA 状态替代增长式 KV 缓存
vllm_project · x · 2026-07-27
- 这条在解释:对 Kimi K3 来说,2.8T 参数并不是最难的部分,缓存这些参数才是。
- 许多层使用的是固定大小的 KDA state,而不是会不断增长的 KV cache,因此不存在按 token 递增的 KV 哈希问题。
- 基于这个设计,前缀缓存被重新实现;作者还表示,K3 之后的所有 hybrid model 都能继承这个结果。
- 配图展示了模型内部结构:Kimi Delta Attention、Gated MLA、Stable LatentMoE 以及围绕 KDA 的分块堆栈。
所属事件:vLLM解析Kimi K3:2.8T参数的缓存才是真正挑战(2 条相关)→
「Infra」频道最新
- Claude 对话被索引后,机密计算方案被再次推上台面 — bittingthembits · 2026-07-27
- Moonshot 开源 MoonEP,开闭源之争再被点燃 — KyeGomezB · 2026-07-27
- Kimi K3 的 2.5 倍 scaling-law 提升引发效率讨论 — andrew_n_carr · 2026-07-27
- Kimi K3 登陆 Nebius:100 万上下文、AA 57 分 — teortaxesTex · 2026-07-27
- AI agent 发现 Bun 的 `child_process.spawn` 兼容性旧 bug — steipete · 2026-07-27
- llama.cpp 在 PR 25994 中加入 Nanbeige4.2 支持 — pmttyji · 2026-07-27