趋境科技详解:用 Mooncake 把 KVCache 池化,托起日均万亿 Token 工厂
量子位 · wechat · 2026-09-11
趋境科技/KVCache.AI 公开其日均万亿级 Token 生产系统的推理架构:某头部万亿参数模型的生产实践中,单台算力 Token 生产效率自 2026 年春节以来提升超 3 倍,总产能增长超 30 倍,核心是用 MooncakeStore 将 KVCache 从单机资源升级为集群级共享池。
- 背景:Agentic workload(编码 Agent、多轮推理、工具调用)反复复用长上下文,一次 Cache Miss 可能意味着数十万 Token 重算;万亿规模下几个百分点的算力浪费都是巨额成本
- 架构:Prefill-Decode 分离,仅 Prefill 节点开 SGLang HiCache;MooncakeStore 以独立进程部署,把分散的 Host DRAM 组成分布式缓存池,RDMA 传输,800Gbps 网卡;推理引擎与缓存系统解耦,可独立升级
- 调度:基于 SMG 的集群调度,综合本地命中率、负载、请求特征决策,避免 CacheLocality 追求导致的热点堆积;Kubernetes 层用 RBG 统一编排
- 性能:KVCache 命中率稳定在 90% 以上,平均批量读取延时 <50ms,靠异步 prefetch 把远端读取隐藏在计算之后
- 踩坑与优化:Master 的 LRU eviction 长占 shard 写锁导致延迟飙升——移出耗时操作、锁粒度从 shard 降到对象级;节点扩缩容的内存申请与 RDMA 注册耗时——优化后获数倍提升,并支持大页
- 全过程采用小规模验证→长稳测试→灰度→全量的逐级放大流程
「Infra」频道最新
- 给 NVIDIA PAIR 加 AMD ROCm 遥测,双节点集群跑通 llama.cpp 路由 — Don_Reuter · 2026-09-11
- 128GB 笔记本本地跑 Qwen3.8 做 Agent 编码,思考 token 才是耗时瓶颈 — deepu105 · 2026-09-11
- AI 数据中心缺燃气轮机,SpaceX 自造稀缺部件或倒逼扩产 — rohanpaul_ai · 2026-09-11
- 从AGI任务时长定义到晶圆厂该不该自训模型的一线观察 — jwt0625 · 2026-09-11
- 免费计算器横评 DeepSeek/Claude/o3-mini 真实token经济学 — nikola_mr64990 · 2026-09-11
- 模型训完才算开始:10 份资源讲透推理部署层 — techNmak · 2026-09-11