Moonshot 的 Mooncake 服务架构让长上下文吞吐最高提升 525%
stochasticchasm · x · 2026-07-28
这篇 arXiv 论文讲的是 Mooncake:Kimi 背后的一个 KV cache 中心化 serving 架构。
它的核心思路是把 prefill 和 decoding 两个集群解耦,并把 GPU 集群里没充分利用的 CPU / DRAM / SSD 资源做成一个 外部 KV cache pool。
主要机制包括:
- 活跃解码块留在 GPU KV cache 中
- 可复用的前缀在被驱逐后写回 CPU DRAM
- 下次复用前再预取回来
- 训练状态在每轮 rollout 后卸到 NVMe,腾出 DRAM
- 针对过载场景加入基于预测的早拒绝策略
论文给出的结果也很强:
- 在某些模拟长上下文场景中,吞吐最高提升 525%
- 在真实负载下,Kimi 的请求处理量提升了 75%
这是一个非常典型的“模型服务基础设施”论文,重点不在模型本身,而在长上下文推理与 RL rollout 的系统架构优化。
「Infra」频道最新
- SSI 称获 NVIDIA 投资,未来 12 个月算力将扩 10 倍 — vitaliychiley · 2026-07-28
- Macrocosmos 启动三大洲分布式的 160 亿参数训练 — markjeffrey · 2026-07-28
- 优化 K8s 资源配置,Whisper 工作流提速 9 倍 — anacondainc · 2026-07-28
- Celestica AI 服务器毛利率三季降至 10.8% — tengyanAI · 2026-07-28
- 线性注意力混合架构需要更细粒度缓存来应对长提示词 — stochasticchasm · 2026-07-28
- 研究型 agent 横评 8 个股票数据 MCP,Equibles 排第一 — DanielAPO · 2026-07-28