vLLM 推出 Hybrid HiSparse:KV 溢出 GPU 也能继续解码,1M 上下文并发翻两番

vllm_project · x · 2026-09-09

vLLM 项目(RedHat AI 与 Prime Intellect 等社区共建)介绍 Hybrid HiSparse 机制:基于 Sparse MLA 只关注 top-K token 的特性,GPU 上无需容纳全部 KV。请求在 KV 超出 HBM 容量后仍可继续解码而不被抢占。

工作方式:显存有余时 KV 照常留在 GPU;压力增大时把最冷的页换出到主机内存,只保留索引器需要的小型热缓冲。技术要点包括:热页是来自同一内存池的普通 KV 块(Hybrid Memory Allocator);单个融合 kernel 同时处理常驻、热与缺失的行,且可被 CUDA-graph 捕获;prefix caching、OffloadingConnector、P/D 导入和 MTP 均保持可用。

实测:在单节点 8× H200、GLM 5.3、完整 1M 上下文、配置并发 32 的条件下,传统 KV offloading 只能维持 5-6 个请求运行,Hybrid HiSparse 维持 19-25 个。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →