结构化KV压缩让A100长上下文并发翻倍
Connect-Concert-4016 · reddit · 2026-07-08
开发者在vLLM 0.20.2、单张A100 80GB、Qwen3 4B Instruct、每用户128K上下文条件下对比三种KV缓存方案:fp16 KV仅支持2个无抢占并发用户、fp8 KV支持5个、结构化压缩KV支持6个,且聚合吞吐量更高、haystack检索仍通过。核心思路是结构化压缩而非驱逐:运行时存储压缩KV页,注意力后端直接读取压缩页,避免回退到fp16拖慢解码。已发布HuggingFace复现卡片。
「Infra」频道最新
- 黄仁勋东京会见日本半导体高层 — nvidia · 2026-07-21
- Infinity 启动并融资 1500 万美元 — mmmbchang · 2026-07-21
- 如何参与Stratum并获取$STRAT — rsalakhu · 2026-07-21
- LLM每token能耗或已低于人脑 — jd_pressman · 2026-07-21
- Couchbase 的多模型 AI 架构实践 — AWS ML Blog · 2026-07-21
- 一天实测Kimi K3:上限高但代价大 — Tarandjpop · 2026-07-21