实测 vLLM 广告 KV cache 注水,压力测试工具揭示真实保留率
t4a8945 · reddit · 2026-09-06
作者在 2x DGX Spark 上用 vLLM 部署 DeepSeek v4 Flash 时怀疑 cache 管理有问题,于是开发了开源工具 cache-pressure 来验证 KV cache 的真实表现。
工具原理(三步协议):
- 先跑 probe 校准 cache 命中/未命中的判定标准
- 填充 X 个各 Y token 的稳定上下文,把 cache 填满
- 按逆序验证 cache 命中,直到首次 miss,得到真实保留值
A/B 对比结果:修复前镜像(retention 4096)在约 202 万 token 容量下只保留 27/80 个上下文(约 105 万 token,占容量 51.98%);打上 dedupe + boundfix 补丁后(retention 0)保留 77/80 个上下文,保留 token 达 300 万,占容量 146.56%——即宣称的 2M cache 实际可保留 3M token。结论是引擎广告的 cache 数字不可信,此工具可拿到 ground truth。
用法:clone 仓库后 python3 bench/cachepressure.py --base-url http://server:8000/v1 --kv-size <advertisedcache>。已测试 vLLM、ninfer、llama.cpp、SGLang。作者观察:vLLM 表现好,其他引擎需调配置。前提假设是「最近的上下文应尽量保留」。
代码全部开源(工具 + prefix cache 修复补丁),作者注明帖子为人工撰写、代码为 AI 辅助生成并经其审核。
「编程与Agent」频道最新
- 作者公开完整 AGENT.md:为编码智能体定制沟通与执行规则 — alexcovo_eth · 2026-09-06
- 开发者拟做自我修复 Agent 框架:轨迹评估循环生成技能 — EnchantedHawk · 2026-09-06
- Polygres 把 Postgres 变成 AI agent 的混合检索上下文层 — Scobleizer · 2026-09-06
- 博主:不会用 AI 自动化工作流的开发者该警醒了 — paul_cal · 2026-09-06
- Ambr 发布:为 AI 智能体引入双格式、SHA-256 绑定的李嘉图合约 — modelcontextprotocol · 2026-09-06
- grounded-mcp 上线:自然语言查询 npm/PyPI 版本与云服务状态 — modelcontextprotocol · 2026-09-06