Kimi K3 报告披露双缓存推理与快照式沙箱
nrehiew_ · x · 2026-07-29
这条线程在拆 Kimi K3 的推理与 sandbox 基础设施,重点是缓存与 checkpoint 的设计。
- 双缓存并行处理:K3 同时处理 KDA state 和 MLA KV cache,因为 KDA 的递归状态形状特殊,不能直接做块级哈希,只能给 MLA 和 KDA 分别设计不同粒度的哈希。
- 细粒度 prefix cache:配图展示了在一个 6144 token 的物理缓存块里,MLA 可以切出多个 512 token 哈希块,但 KDA checkpoint 只在少数边界持久化,因此缓存复用依赖更细的边界设计。
- sandbox 基础设施:线程还提到他们发布了 sandbox infra,主打安全运行与 snapshot 的高效暂停/恢复。
- 另外,作者还提到外部 KV cache 可能 offload 到 CPU、训练状态 offload 到 NVMe,不过这些细节在原帖里也标注了不完全确定。
所属事件:Kimi K3 技术报告深度解读:架构与训练系统全面曝光(18 条相关)→
「Infra」频道最新
- Polymarket 预测州级数据中心禁令年底前概率 60% — Polymarket · 2026-07-29
- NextEra 与 Brookfield 在肯塔基州规划超 1000 亿美元 AI 数据中心园区 — Polymarket · 2026-07-29
- 8 美元 ESP32-S3 跑起 2890 万参数离线模型 — nikola_mr64990 · 2026-07-29
- 高通宣布已完成对 Modular 的收购 — clattner_llvm · 2026-07-29
- AMD 2026 印度 AI 开发者日聚焦智能体、本地 AI 与视频生成 — PyTorch · 2026-07-29
- Meta 可能用首个 compute client 消息配合加码 CapEx — RihardJarc · 2026-07-29