RTX 3090 跑 Qwen3.8-27B 达 672 tps,极致量化优化
iamMess · reddit · 2026-08-17
作者通过一系列量化与缓存优化,显著提升了 Qwen3.6-28B(注:标题为 27B)在 RTX 3090 上的推理速度。核心手段包括 W4A16 量化、FP8 KV Cache、lmhead 及 embedtokens 转 int8,将显存占用降至 14.2GB。结果显示:单请求 82 tps,峰值可达 672 tps,64 并发下维持 417 tps,比 ninfer 快 17% 至 149%。该方案基于 vLLM,质量损失约 0.6%。
「Infra」频道最新
- Wici One 声称通过 NVMe 流式传输解决本地显存瓶颈 — Torodaddy · 2026-08-17
- 单卡 5090 跑出每秒 206 token,Qwen3.8-27B 性能实测 — StefanoGogioso · 2026-08-17
- antirez优化DwarfStar:Station上170 t/s生成,22k tokens/s预填充 — antirez · 2026-08-17
- 算力淘金热:CoreWeave 季度营收超早期巨头云厂商 — a16z · 2026-08-17
- 麦肯锡:自 22 年底美数据中心投资激增 200% — rvp · 2026-08-17
- 250 美元 FPGA 开发板实现 12000 tok/s 推理 — ycombinator · 2026-08-17