vLLM 实测在双 5060 Ti 上跑通 nvfp4 KV cache
gtrak · reddit · 2026-07-21
一个 Reddit 实测帖给出了在 2 张 RTX 5060 Ti 上跑 vLLM + nvfp4 KV cache 的可用启动配置,目标模型是 Qwen3.6-27B-PrismaSCOUT-Blackwell-NVFP4-BF16-vllm。
关键配置
- --kv-cache-dtype nvfp4
- --max-model-len 262144
- --tensor-parallel-size 2
- --kv-offloading-size 20
- 开启 prefix caching 和 chunked prefill
- --cudagraph-capture-sizes 1 2 4
- --compilation-config {"cudagraphmode":"PIECEWISE"},作者指出 FULL 会损坏 XQA
经验参数
- VLLMMEMORYPROFILERESTIMATECUDAGRAPHS=0 约可回收 0.39 GiB 给 MTP 工作区。
- gpu-memory-utilization=0.90 比较稳,0.94 会因为 MTP 缓冲区 OOM。
- 还包含一组 NCCL、进程启动与精度相关参数,用于稳定长上下文推理。
这条的价值在于给出了一个可复现的消费级 GPU 部署方案,适合关注本地推理、长上下文和 speculative decoding 的读者。
「Infra」频道最新
- NVIDIA 发布 Vera Rubin,称每瓦性能提升 10 倍 — nvidia · 2026-07-22
- Devin 接入 e2b 沙箱,支持远程 agent 执行 — badphilosopher · 2026-07-22
- Arbitrum 模拟显示:ArbOS61 提高 gas 容量,但 L2 收入下降 — tomwanhh · 2026-07-22
- NVIDIA 推 OpenUSD 做仿真与物理 AI 通用底座 — MonaJalal_ · 2026-07-22
- SkyPilot 融资 2000 万美元,主打统一碎片化 GPU 算力 — skypilot_org · 2026-07-22
- 生产环境 AI 预算不止 token 价,还包括重试路由和可观测性 — arx-go · 2026-07-22