Qwen3.8-27B 多卡实测:3090极致优化672 tps
Qwen3.8-27B 模型发布后,社区针对不同显卡进行了密集的本地性能实测。RTX 3090 通过极致量化优化达到 672 tps,RTX 5090 与 RTX 6000 Pro 配合 SGLang 技术分别跑出 206 tok/s 与 223 tok/s 的高吞吐。在消费级主流显卡上,如 RTX 4090 和 4080 Super,模型在长上下文编码及日常生成任务中均表现出可用性。
已确认
- @iamMess 在 RTX 3090 上通过 W4A16 量化、FP8 KV Cache、lmhead 及 embedtokens 转 int8 等优化,将推理速度提升至 672 tps
- @StefanoGogioso 转述 SGLang 的 Day-0 支持:单张 RTX 5090 配合 NVFP4 量化与 DSpark 推测解码,解码速度达 206.1 tok/s
- @BanghuaZ 转述:RTX 6000 Pro(96GB)使用 SGLang 脚本、NVFP4 权重及 DSpark 推测解码,单流吞吐量为 200-223 tok/s
- @julianharris 在 RTX 4090 上使用 unsloth 4bit 量化实测,128k 上下文编码场景下速度为 73 tok/s;关闭思考模式后提速至 78 tok/s 但质量明显下降
- @BopSupreme 在 RTX 4080 Super(16GB)上全 GPU 卸载运行,速度约 39 tok/s,26K token 真实负载下约 34 tok/s
- @cocktailpeanut 转述用户 zast57:RTX 4090 经 Pinokio 一键部署 Ollama + OpenWebUI,运行 27B 模型在校对等文本任务中接近 100 tok/s
尚未确认
- @iamMess 提供的 672 tps 数据未明确区分是预填充还是解码速度,其测量口径与其他实测(两位数至两百出头)存在显著差异,待作者补充说明
为什么重要
- 极致优化案例(如 672 tps)与高端卡实测展示了该模型在硬件潜力上的上限,而中端显卡(如 4080 Super)的流畅运行证明其已具备广泛的本地部署可行性
- 思考模式的取舍实测为用户在本地部署时平衡速度与质量提供了直观参考
2026-08-16 ~ 2026-08-17 · 6 条相关
一手来源
- RTX 3090 跑 Qwen3.8-27B 达 672 tps,极致量化优化 — iamMess ·
- Qwen3.8 27B 在 RTX 4080 Super 上跑出 39 tok/s,本地编码够用 — BopSupreme ·
- Qwen 3.8 27b本地编码实测:128k上下文73 tok/s,性能可用 — julianharris ·
- 4090 本地跑 Qwen 27B:近100 token/s — cocktailpeanut · 2026-08-16
- RTX 6000 Pro 跑 Qwen3.8-27B 达 223 tok/s — BanghuaZ · 2026-08-17
- 【源头】Qwen 3.8 27b本地编码实测:128k上下文73 tok/s,性能可用 — julianharris · 2026-08-17
- 【源头】RTX 3090 跑 Qwen3.8-27B 达 672 tps,极致量化优化 — iamMess · 2026-08-17
- 单卡 5090 跑出每秒 206 token,Qwen3.8-27B 性能实测 — StefanoGogioso · 2026-08-17
- 【源头】Qwen3.8 27B 在 RTX 4080 Super 上跑出 39 tok/s,本地编码够用 — BopSupreme · 2026-08-17