vLLM 引入 HiSparse 混合卸载,GLM 5.3 KV 溢出仍可继续解码

vLLM Blog · rss · 2026-09-08

vLLM 博客详解针对 GLM 5.3 的推理优化:将 HiSparse 集成为压力驱动的显存分层,与 Hybrid Memory Allocator 及 KV offloading 协同工作。当请求的 KV cache 超出 GPU 显存时,解码仍可持续进行,从而在高并发下保持吞吐。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →