Nebius/WEKA 实测:分布式 KV cache 让单节点 agent 推理吞吐提升 2.4 倍
AccBalanced · x · 2026-09-25
Nebius 与 WEKA 在 NVIDIA HGX B300 上对共享 KV cache 层(WEKA NeuralMesh Augmented Memory Grid)做了 8 小时持续压测,重放真实 agentic coding 流量运行 DeepSeek-V4-Pro。
- 结果:同一服务节点吞吐提升 2.4 倍,cache 命中率 93%(仅用 GPU HBM 时为 40%)。
- 背景:agent 每轮工具调用都是一次新推理请求,prompt 含全部历史;会话超出 GPU 显存后被迫整体重算 prefill,溢出到单机 DRAM 也无法跨节点命中。
- 方法:对比仅切换 KV cache 层,其余条件不变——单节点 8 卡 B300、TP=8、相同 vLLM 栈、512 个活跃会话(取自 5000+ 条真实捕获的 agent 会话)。
- 作者同时批评厂商自选基准(bait & switch)不可信,主张用真实负载、开放 trace、长时程 agent 由一线 AI 云直接测试。
「Infra」频道最新
- GPU 到底怎么跑深度学习:一篇讲透内存层级与优化策略的入门长文 — goyal__pramod · 2026-09-25
- VeriTile:用 Lean 形式化验证 Triton GPU 内核,AI 智能体自动写正确性证明 — KaiyuYang4 · 2026-09-25
- Merge Gateway 推出 Batch API,批量推理约半价 — shensi · 2026-09-25
- 工程师发文详解生产环境 LLM 推理扩容实践 — abhijithneil · 2026-09-25
- Lambda 工程师详解本地推理装机:27B 模型需 24-32GB 显存 — TheZachMueller · 2026-09-25
- Pokee AI 现场演示 36B agent 模型跑在 32GB 内存的骁龙笔记本上 — Kyrannio · 2026-09-25