两套 Blackwell vLLM 方案:NVFP4 KV 缓存换来 26 万上下文
SeanHighness · reddit · 2026-08-27
作者发布了两套面向 Blackwell GPU 的 vLLM 配置方案,核心理念是让 KV cache 也用上 Blackwell 的原生 FP4 能力,而不只是模型权重。
NVFP4 KV 的意义:KV cache 是长上下文/多并发下最大的显存消耗之一,将其从 BF16/FP8 压到 FP4 后,可腾出显存给更长上下文、更多并发流和更大的 KV 池。在 RTX 5090 上,区别在于"仅能支持 262K 上下文"与"同时服务多个可用流"。
两套方案定位:
- MTP-3(容量优先):约 400K KV 池、最多 8 流、262K 上下文,适合多智能体/多用户/长上下文;
- DFlash2(速度优先):约 325K KV 池、最多 4 流,投机解码明显更快,适合单流低并发。
其他亮点:视觉编码器跑在 CPU sidecar 上,不占 GPU 显存但保留多模态输入;组合了上游 vLLM 尚未合并的 NVFP4 权重 + NVFP4 KV + 投机解码 + Blackwell 内核等能力,打包成可复现构建。
适用建议:适合 RTX 5090、双 16GB Blackwell 卡等 FP4 原生硬件,跑 sub-agent、多用户推理、并行编码智能体;追求稳定官方支持的生产环境则应继续用原版 vLLM。
「编程与Agent」频道最新
- 实战:连接 Agent 与 HuggingNews 自建新闻通知 — ivan_bezdomny · 2026-08-27
- Garry Tan:区分潜在与确定性计算可避免 Agent 失败 — garrytan · 2026-08-27
- 用 GrokBot 管理 VPS:安装 Tailscale、SSH 配置全自动 — DanWahlin · 2026-08-27
- 智能体演示攻破 OpenAI 基础设施窃取密钥 — AndyMasley · 2026-08-27
- Super Star:数字人实时交互智能体流式生成框架 — Wentao Jiang · 2026-08-27
- JIT-Agent:通过即时 Harness 进化提升模型智能 — NationalUniversityofSingapore · 2026-08-27