Moonshot 的 Mooncake 服务架构让长上下文吞吐最高提升 525%
stochasticchasm · x · 2026-07-28
这篇 arXiv 论文讲的是 Mooncake:Kimi 背后的一个 KV cache 中心化 serving 架构。
它的核心思路是把 prefill 和 decoding 两个集群解耦,并把 GPU 集群里没充分利用的 CPU / DRAM / SSD 资源做成一个 外部 KV cache pool。
主要机制包括:
- 活跃解码块留在 GPU KV cache 中
- 可复用的前缀在被驱逐后写回 CPU DRAM
- 下次复用前再预取回来
- 训练状态在每轮 rollout 后卸到 NVMe,腾出 DRAM
- 针对过载场景加入基于预测的早拒绝策略
论文给出的结果也很强:
- 在某些模拟长上下文场景中,吞吐最高提升 525%
- 在真实负载下,Kimi 的请求处理量提升了 75%
这是一个非常典型的“模型服务基础设施”论文,重点不在模型本身,而在长上下文推理与 RL rollout 的系统架构优化。
「Infra」频道最新
- Rat Stack:把应用和云写成一个类型化程序,让 AI agent 可靠地搭建部署 — samgoodwin89 · 2026-09-23
- optimAIzr:本地 CLI 找出 AI 用量浪费,支持 Claude Code 与 Codex 省钱 — stichstichstich · 2026-09-23
- 256GB 内存版 Mac Studio 二手溢价 6000 美元仍一机难求 — GabGarrett · 2026-09-23
- Ben Bajarin 解析 AI 数据中心:CPU 与内存如何限制 GPU 推理服务能力 — BenBajarin · 2026-09-23
- Epoch AI 报告:「思考」的价格正在暴跌,智能成本持续陡降 — Proper_Actuary2907 · 2026-09-23
- 从燃气到吉瓦:Diligence Stack 专家访谈拆解 AI 数据中心供电难题 — BenBajarin · 2026-09-23