vLLM 引入 HiSparse 混合卸载,GLM 5.3 KV 溢出仍可继续解码
vLLM Blog · rss · 2026-09-08
vLLM 博客详解针对 GLM 5.3 的推理优化:将 HiSparse 集成为压力驱动的显存分层,与 Hybrid Memory Allocator 及 KV offloading 协同工作。当请求的 KV cache 超出 GPU 显存时,解码仍可持续进行,从而在高并发下保持吞吐。
- HiSparse 作为按显存压力触发的内存层,而非固定配置
- 与 KV 卸载组合,避免解码中断
- 目标是在 KV 溢出场景下维持高并发
「Infra」频道最新
- D-Wave 与美商务部签约,获最高 1 亿美元 CHIPS 法案资金 — ceciletamura · 2026-09-08
- 出口管制见效?海外 H200 仅 280、B300 仅 450 的价格之问 — teortaxesTex · 2026-09-08
- Arm 发布 AI Portal:预优化 Qwen、Gemma 模型可经 MCP 供编码 Agent 调用 — Crescitaly · 2026-09-08
- Serverless 跑 AI 不一定省钱:静态负载下成本反更高 — DavidLinthicum · 2026-09-08
- 买 5849 欧 M5 Max 128GB 本地跑 Qwen,还是等 2028 年的 M7 Ultra? — Mxmtm · 2026-09-08
- FT 独家:华为全产业链押注光刻设备,意图清除中国芯片外资依赖 — EleanorOlcott · 2026-09-08