5090 跑 Qwen3.8-27B:vLLM NVFP4 可行,FP8 基本无望

BitGreen1270 · reddit · 2026-10-11

Reddit 用户在 vLLM 下实测 Qwen3.8-27B 的量化部署:FP8 版本(仓库 30.9GB)受显存与最小上下文限制,在 RTX 5090 上几乎不可能实用;但 NVFP4 量化版(QUASAR-QAT)表现优异,可带图高上下文运行,无图可达 256k。帖中给出完整可复用的 vllm serve 配置:expandablesegments、8GB KV cache 限额、fp8 KV cache、prefix caching、qwen3coder 工具解析器、MTP 投机解码 3 token 等,对单卡本地部署 27B 级模型有直接参考价值。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →