vLLM 引入 HiSparse 分级卸载,KV 溢出时 GLM 5.3 解码不再中断

vLLM Blog · rss · 2026-09-07

vLLM 博客介绍了针对 GLM 5.3 的混合 HiSparse 卸载优化(系列第一篇)。HiSparse 被集成为一层由显存压力驱动的存储分级,与混合内存分配器和 KV 卸载机制协同工作:当请求的 KV cache 超出 GPU 显存时,可被卸载而保持解码继续进行,从而在不牺牲吞吐的情况下维持高并发。

关键点:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →