HiSparse 混合稀疏注意力进 vLLM,8×H200 并发从 5 提到 25
eliebakouch · x · 2026-09-09
- samsja19 团队宣布与 vLLM 合作推进稀疏注意力与 HiSparse。稀疏注意力只选 top-K token 做注意力,能降低内存带宽压力,但不减少 KV cache 的显存占用;在高吞吐 wide-EP 部署中,长序列解码很快耗尽 VRAM,无法用足够并发请求吃满算力。
- HiSparse 的解法是把不活跃 KV 卸载到 CPU:GPU 上保留 LRU 热缓存,由于解码时大量 K token 被重复使用,卸载几乎无感,从而大幅降内存、提并发,对追求吞吐、希望尽量处于 compute-bound 区间的 RL 训练尤其重要。
- vLLM 侧的 Hybrid HiSparse 基于 Sparse MLA(只关注 top-K token,其余 KV 无需常驻 GPU):显存有余时 KV 留在 GPU,压力下把最冷页释放到主机内存,仅保留 indexer 需要的小型热缓冲,请求可继续解码而不被抢占。
- 实测数据:在单个 8×H200 节点、GLM 5.3、完整 1M 上下文、配置并发 32 的条件下,普通 KV offloading 只能维持 5-6 个请求运行,Hybrid HiSparse 维持 19-25 个。热页是同一内存池中的普通 KV 块(Hybrid Memory Allocator),并用单个融合 kernel 完成解析。
所属事件:vLLM 引入 HiSparse 混合稀疏注意力,长上下文并发翻两番(2 条相关)→
「Infra」频道最新
- 播客热议 Broadcom 定制 ASIC 与 2027 供给瓶颈,兼谈 Nvidia 收购 Hugging Face — BenBajarin · 2026-09-09
- Magnitude 开源 Apple 芯片推理服务器:自动为 Mac 选型调优本地模型 — nickbaumann_ · 2026-09-09
- Cerebras 论文:层 dropout 省四分之一训练算力,推理提速 1.55 倍 — burny_tech · 2026-09-09
- Viettel 三层开源栈统一 GPU 集群,打造 Token-as-a-Service 平台 — PyTorch · 2026-09-09
- 动作每回合都变?把工具 Schema 放最后一条消息保住缓存 — Low_Bad_6585 · 2026-09-09
- 开源项目 minnow:主打高速的 LLaDA2.2 推理服务器 — coder543 · 2026-09-09