SGLang 上线 NVFP4 4-bit KV Cache:长上下文解码提速最高 78%
BanghuaZ · x · 2026-09-22
- 发布:LMSYS 与 Qwen(阿里)、NVIDIA 合作,在 SGLang 中为 Blackwell GPU 带来 NVFP4 4-bit KV cache,加速长上下文与 Agent 推理。
- 内存:NVFP4 每 token 仅占 FP8 约 56% 的显存,可多装约 1.78 倍上下文。
- 吞吐:解码吞吐在 32K/160K/1M 上下文分别提升 37%/58%/78%。
- 精度:在 Qwen3.5-397B-A17B 上与 FP8 基本无损,GPQA-Diamond 与 AIME 2025 成绩持平;更高缓存命中率使 AgentX 吞吐在 FP8 衰减处继续扩展。
- 实现:结合 NVFP4 两级缩放、decode 内核内反量化与分页 KV cache,SGLang 中一个参数 --kv-cache-dtype nvfp4 即可启用。
「Infra」频道最新
- SemiAnalysis 深文:MoE 模型如何映射到推理硬件的算力与数据搬运 — zephyr_z9 · 2026-09-22
- Huawei HiZQ 是真 HBM,DeepSeek 一切设计都在省带宽 — zephyr_z9 · 2026-09-22
- Halo 训练平台发布:SGLang 担纲主力 rollout 引擎支持异步 RL — ying11231 · 2026-09-22
- SiliconBench:评测九款 Apple Silicon 引擎的速度、内存与保真度 — PennState · 2026-09-22
- Engram 检索架构省不了全部参数,但可砍 40-50% HBM 需求 — bookwormengr · 2026-09-22
- 华为 9·19 发布解读:长程 Agent 瓶颈在数据搬运而非算力 — krishnan · 2026-09-22