RTX 3090 跑 Qwen3.8-27B 达 672 tps,极致量化优化

iamMess · reddit · 2026-08-17

作者通过一系列量化与缓存优化,显著提升了 Qwen3.6-28B(注:标题为 27B)在 RTX 3090 上的推理速度。核心手段包括 W4A16 量化、FP8 KV Cache、lmhead 及 embedtokens 转 int8,将显存占用降至 14.2GB。结果显示:单请求 82 tps,峰值可达 672 tps,64 并发下维持 417 tps,比 ninfer 快 17% 至 149%。该方案基于 vLLM,质量损失约 0.6%。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →