RTX 3090 部署 Qwen3.8-27B:vLLM 胜出
Lower-Ad6101 · reddit · 2026-08-28
Reddit 用户分享了在 RTX 3090 上优化部署 Qwen3.8-27B 的详细实践。
llama.cpp 配置:
- 使用 Q4KXL 量化与 MTP/ngram 推测解码。
- 开启 CUDA Graphs 和 Flash Attention。
- 在 150K 上下文下达到 45-50 tps。
vLLM 对比:
- 切换到 vLLM Docker 部署后,性能提升至 55-65 tps,上下文扩展至 175K+。
- 缺点是无法将视觉模型 (mmproj) 卸载至 CPU(带视觉时上下文受限)。
量化方案讨论:
用户询问 vLLM 中的 W4A16-AutoRound 编码相比 Q4KXL 在 C/C++ 和 Python 编程任务上的质量差异,推测其介于 Q4KM 和 Q4KL 之间。
「编程与Agent」频道最新
- GPT-5.6 Sol 一下午逆向重构 32 位 iOS 游戏 — gpt2chatbot · 2026-08-28
- 用 Grok 搞定 80% 求职工作流:自动申请与时间管理 — brandon_galang · 2026-08-28
- GitHub 项目:用 Agent 自动生成 3D 资产并构建游戏 — const_reborn · 2026-08-28
- Replit 推出智能模型路由,自动选择最优模型 — amasad · 2026-08-28
- 技术提问:如何让 GPT 持续检查状态并执行长周期任务? — BLUECOW009 · 2026-08-28
- 把 AI Agent 安全面向分层问题:一套安全思维模型 — joshua_saxe · 2026-08-28