双 3090 跑 Qwen3.8-27B:vLLM 加 DFlash2 解码飙到 218 tok/s
xjx546 · reddit · 2026-08-19
Reddit 网友在 2× RTX 3090(PCIe Gen4、无 NVLink、修补 P2P、功耗锁 220/250W)上实测 Qwen3.8-27B 的推理性能,使用 vLLM v0.26.1rc1 + AutoRound INT4(group 128)+ DFlash2 draft 模型的投机解码方案:
- 代码任务解码速度达 218.3 tok/s,叙事类 120.1 tok/s;TTFT 约 170ms
- Prefill:10k 上下文 1342 tok/s,90k 上下文 628 tok/s
- 投机解码:7 个 draft token,接受率 47.8%,平均接受长度 3.35
- 峰值显存 22.3 GB/卡,无泄漏;上下文上限 131k(drafter 占约 13.5GB)
- 测量采用 Club-3090 标准测试套件(3 次预热 + 5 次测量,temp 0.6/topp 0.95/topk 20),作者称还有优化空间
- 为让 vLLM 正常启动做了自定义修改,并称用 Kimi K3 完成了全部 vLLM 修复
「Infra」频道最新
- Inco AI 推出 DFlash 2,推理提速最高 4.6 倍 — igilitschenski · 2026-08-19
- 未来能否在小显存 GPU 上运行 30B+ 参数的大模型? — absurdother · 2026-08-19
- Periodic Labs 基于 Miles 框架训练万亿参数模型,吞吐提速3倍 — hsu_byron · 2026-08-19
- 本地 LLM 速度瓶颈解析:4090 与 5090 性能差异 — Viktri1 · 2026-08-19
- LLM 推理工程教程:从 KV Cache 到 vLLM — techNmak · 2026-08-19
- DFlash 2 发布:MacBook 跑 Qwen3.8-27B 速达 70 tok/s — songhan_mit · 2026-08-19