2x3090 跑 Qwen3.8-27B:单流 70 tok/s、262k 满上下文
maqifrnswa · reddit · 2026-09-22
作者在 2x3090 上用原生 vLLM 跑 Qwen3.8-27B-INT4(RedHatAI 量化版),实测单流解码超 70 tok/s,3-4 并发时近 200 tok/s,预填充超 10k tok/s,262k 满上下文,KV 缓存可同时容纳近两个完整上下文。关键配置:INT4 量化(Ampere 理想选择)、fp8 加权 KV 缓存(性能与 bf16 几乎一致)、MTP 投机解码 3 tokens、tensor-parallel-size 2、prefix caching 等,完整 vllm serve 命令已贴出。作者用 vLLM metrics API + Prometheus + vllm bench serve 在真实工作流上持续调优一个月,认为 RedHat 的量化版被严重低估。
「Infra」频道最新
- 曝 DeepSeek 押注华为芯片,绕开美国出口管制 — pstAsiatech · 2026-09-22
- Whittle 蒸馏模型走红 Reddit,27B-A3B 声称可在 8GB 显存笔记本跑 — depressedclassical · 2026-09-22
- Qdrant 实测:百万级向量搜索延迟抖动是后台优化器在干活 — qdrant_engine · 2026-09-22
- 免推理 SPLADE 检索:查询延迟降到 BM25 水平的做法 — qdrant_engine · 2026-09-22
- Cloudflare 全家桶的真实短板:D1 单线程、10GB 上限 — Paimaamu · 2026-09-22
- Rackspace 加入 NVIDIA 云伙伴计划,押注受监管行业全栈 AI 运维 — DavidLinthicum · 2026-09-22