2x3090 跑 Qwen3.8-27B:单流 70 tok/s、262k 满上下文

maqifrnswa · reddit · 2026-09-22

作者在 2x3090 上用原生 vLLM 跑 Qwen3.8-27B-INT4(RedHatAI 量化版),实测单流解码超 70 tok/s,3-4 并发时近 200 tok/s,预填充超 10k tok/s,262k 满上下文,KV 缓存可同时容纳近两个完整上下文。关键配置:INT4 量化(Ampere 理想选择)、fp8 加权 KV 缓存(性能与 bf16 几乎一致)、MTP 投机解码 3 tokens、tensor-parallel-size 2、prefix caching 等,完整 vllm serve 命令已贴出。作者用 vLLM metrics API + Prometheus + vllm bench serve 在真实工作流上持续调优一个月,认为 RedHat 的量化版被严重低估。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →