分布式 KV cache 实测:agent 推理吞吐提升 2.4 倍

Nebius 与 WEKA 在 NVIDIA HGX B300 上对共享 KV cache 层(WEKA NeuralMesh Augmented Memory Grid)进行了 8 节点测试,结果显示分布式 KV cache 可让单节点 agent 推理吞吐提升 2.4 倍。作者 @AccBalanced 进一步呼吁云厂商关注「正确做好 KV offloading」带来的巨大杠杆:token 吞吐、用户体验(UX/AX)以及营收与利润率空间都有提升潜力,同时批评部分厂商的基准测试存在造假问题。

2026-09-25 ~ 2026-09-26 · 2 条相关