两套 Blackwell vLLM 方案:NVFP4 KV 缓存换来 26 万上下文

SeanHighness · reddit · 2026-08-27

作者发布了两套面向 Blackwell GPU 的 vLLM 配置方案,核心理念是让 KV cache 也用上 Blackwell 的原生 FP4 能力,而不只是模型权重。

NVFP4 KV 的意义:KV cache 是长上下文/多并发下最大的显存消耗之一,将其从 BF16/FP8 压到 FP4 后,可腾出显存给更长上下文、更多并发流和更大的 KV 池。在 RTX 5090 上,区别在于"仅能支持 262K 上下文"与"同时服务多个可用流"。

两套方案定位:

其他亮点:视觉编码器跑在 CPU sidecar 上,不占 GPU 显存但保留多模态输入;组合了上游 vLLM 尚未合并的 NVFP4 权重 + NVFP4 KV + 投机解码 + Blackwell 内核等能力,打包成可复现构建。

适用建议:适合 RTX 5090、双 16GB Blackwell 卡等 FP4 原生硬件,跑 sub-agent、多用户推理、并行编码智能体;追求稳定官方支持的生产环境则应继续用原版 vLLM。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →