Moonshot 的 Mooncake 服务架构让长上下文吞吐最高提升 525%

stochasticchasm · x · 2026-07-28

这篇 arXiv 论文讲的是 Mooncake:Kimi 背后的一个 KV cache 中心化 serving 架构。

它的核心思路是把 prefill 和 decoding 两个集群解耦,并把 GPU 集群里没充分利用的 CPU / DRAM / SSD 资源做成一个 外部 KV cache pool。

主要机制包括:

论文给出的结果也很强:

这是一个非常典型的“模型服务基础设施”论文,重点不在模型本身,而在长上下文推理与 RL rollout 的系统架构优化。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →