vLLM 实测在双 5060 Ti 上跑通 nvfp4 KV cache

gtrak · reddit · 2026-07-21

一个 Reddit 实测帖给出了在 2 张 RTX 5060 Ti 上跑 vLLM + nvfp4 KV cache 的可用启动配置,目标模型是 Qwen3.6-27B-PrismaSCOUT-Blackwell-NVFP4-BF16-vllm。

关键配置

经验参数

这条的价值在于给出了一个可复现的消费级 GPU 部署方案,适合关注本地推理、长上下文和 speculative decoding 的读者。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →