结构化KV压缩让A100长上下文并发翻倍

Connect-Concert-4016 · reddit · 2026-07-08

开发者在vLLM 0.20.2、单张A100 80GB、Qwen3 4B Instruct、每用户128K上下文条件下对比三种KV缓存方案:fp16 KV仅支持2个无抢占并发用户、fp8 KV支持5个、结构化压缩KV支持6个,且聚合吞吐量更高、haystack检索仍通过。核心思路是结构化压缩而非驱逐:运行时存储压缩KV页,注意力后端直接读取压缩页,避免回退到fp16拖慢解码。已发布HuggingFace复现卡片。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →