5090 跑 Qwen3.8-27B:vLLM NVFP4 可行,FP8 基本无望
BitGreen1270 · reddit · 2026-10-11
Reddit 用户在 vLLM 下实测 Qwen3.8-27B 的量化部署:FP8 版本(仓库 30.9GB)受显存与最小上下文限制,在 RTX 5090 上几乎不可能实用;但 NVFP4 量化版(QUASAR-QAT)表现优异,可带图高上下文运行,无图可达 256k。帖中给出完整可复用的 vllm serve 配置:expandablesegments、8GB KV cache 限额、fp8 KV cache、prefix caching、qwen3coder 工具解析器、MTP 投机解码 3 token 等,对单卡本地部署 27B 级模型有直接参考价值。
「Infra」频道最新
- M5 Ultra Mac Studio 64 核 vs 80 核:多花 1200 美元等 10 周值吗 — Porespellar · 2026-10-11
- 弗州动物收容所控诉:邻近数据中心噪音吓坏救援犬 — Polymarket · 2026-10-11
- AI 扩散更像病毒传播?Reddit 长文质疑 7000 亿美元基建狂欢 — thepotatobake · 2026-10-11
- Recall 开源:纯本地语义搜索,i5 核显 0.17 秒搜 PDF 音视频 — somthing_tn · 2026-10-11
- 192GB 显存跑 426GB MXFP4 版 DeepSeek,多 agent 代码审查实测 — HankYeomans · 2026-10-11
- awesome-local-ai:按任务分类的本地 AI 工具清单,专为 agent 设计 — blaizedsouza · 2026-10-11