vLLM 引入 HiSparse 分级卸载,KV 溢出时 GLM 5.3 解码不再中断
vLLM Blog · rss · 2026-09-07
vLLM 博客介绍了针对 GLM 5.3 的混合 HiSparse 卸载优化(系列第一篇)。HiSparse 被集成为一层由显存压力驱动的存储分级,与混合内存分配器和 KV 卸载机制协同工作:当请求的 KV cache 超出 GPU 显存时,可被卸载而保持解码继续进行,从而在不牺牲吞吐的情况下维持高并发。
关键点:
- HiSparse 是压力驱动的显存分级,而非静态配置
- 与 Hybrid Memory Allocator、KV offloading 组合使用
- 目标场景是长上下文/高并发下 KV 溢出导致的解码停顿
「Infra」频道最新
- M.2-Oculink 显卡链路暗降 PCIe 1x,附 lspci 排查命令 — El_90 · 2026-09-11
- DeepSeek 发布 V4.1-Flash:百万 token 上下文,KV 缓存缩小 4 倍 — matlabulous · 2026-09-11
- 8GB 显存还能干嘛?网友求解小模型现状与推荐 — riceinmybelly · 2026-09-11
- 西班牙新规要求 80% 逐小时绿电匹配,数据中心建设或耗资千亿欧元 — eherrerosj · 2026-09-11
- Draghi 引用 ECB 研究:AI 或每年提振欧洲生产率 0.3-0.4 个百分点 — rohanpaul_ai · 2026-09-11
- 高通新一代 Hexagon NPU 曝光:可跑 30B MoE,上下文 32K — lee_stott · 2026-09-11