实测 vLLM 广告 KV cache 注水,压力测试工具揭示真实保留率

t4a8945 · reddit · 2026-09-06

作者在 2x DGX Spark 上用 vLLM 部署 DeepSeek v4 Flash 时怀疑 cache 管理有问题,于是开发了开源工具 cache-pressure 来验证 KV cache 的真实表现。

工具原理(三步协议):

A/B 对比结果:修复前镜像(retention 4096)在约 202 万 token 容量下只保留 27/80 个上下文(约 105 万 token,占容量 51.98%);打上 dedupe + boundfix 补丁后(retention 0)保留 77/80 个上下文,保留 token 达 300 万,占容量 146.56%——即宣称的 2M cache 实际可保留 3M token。结论是引擎广告的 cache 数字不可信,此工具可拿到 ground truth。

用法:clone 仓库后 python3 bench/cachepressure.py --base-url http://server:8000/v1 --kv-size <advertisedcache>。已测试 vLLM、ninfer、llama.cpp、SGLang。作者观察:vLLM 表现好,其他引擎需调配置。前提假设是「最近的上下文应尽量保留」。

代码全部开源(工具 + prefix cache 修复补丁),作者注明帖子为人工撰写、代码为 AI 辅助生成并经其审核。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →