vLLM 推出 Hybrid HiSparse:KV 溢出 GPU 也能继续解码,1M 上下文并发翻两番
vllm_project · x · 2026-09-09
vLLM 项目(RedHat AI 与 Prime Intellect 等社区共建)介绍 Hybrid HiSparse 机制:基于 Sparse MLA 只关注 top-K token 的特性,GPU 上无需容纳全部 KV。请求在 KV 超出 HBM 容量后仍可继续解码而不被抢占。
工作方式:显存有余时 KV 照常留在 GPU;压力增大时把最冷的页换出到主机内存,只保留索引器需要的小型热缓冲。技术要点包括:热页是来自同一内存池的普通 KV 块(Hybrid Memory Allocator);单个融合 kernel 同时处理常驻、热与缺失的行,且可被 CUDA-graph 捕获;prefix caching、OffloadingConnector、P/D 导入和 MTP 均保持可用。
实测:在单节点 8× H200、GLM 5.3、完整 1M 上下文、配置并发 32 的条件下,传统 KV offloading 只能维持 5-6 个请求运行,Hybrid HiSparse 维持 19-25 个。
「Infra」频道最新
- NVIDIA 发布 CUDA Python 1.0:Python 成 CUDA 一等公民 — PyTorch · 2026-09-09
- 推理服务正把 GPU 算力变成可交易商品,商业模式剖析 — ArtificialAnlys · 2026-09-09
- Cohere 开源解码 megakernel 推理引擎,比 vLLM 快最高 1.58 倍 — cohere · 2026-09-09
- 求解 Navier-Stokes 花掉 1300 亿输出 token,按不同模型算高达 1800 万美元 — mitsuhiko · 2026-09-09
- Baseten 将前沿模型增量权重同步压至 40 秒内,仅 6 秒请求暂停 — baseten · 2026-09-09
- 戴尔高管:DRAM最紧缺,先进制程几乎全线供应受限 — Beth_Kindig · 2026-09-09