投机解码让 Qwen3.6-27B 在单卡上起飞,高并发却会拖慢服务器
luke_pacman · reddit · 2026-07-21
这篇实测对 Unsloth 的 Qwen3.6-27B NVFP4 做了单卡和双卡 RTX 5090 测试,结论是:投机解码(speculative decoding)在空闲场景下很有用,但在高并发下可能反而拖慢服务器。
关键结果:
- 在 1 张 RTX 5090 上,nspec=3 把 decode 速度从 66 tok/s 提升到 120 tok/s。
- 在 2 张 RTX 5090 上,同样设置只到 108 tok/s,相比无 MTP 的 99 tok/s 提升很有限。
- 一旦进入批处理场景,收益迅速衰减:8 并发时只剩 +5%,到 12–16 并发时反而变成 22–37% 的降速。
- 通过率大致稳定在 71–73%,说明问题不在于接受率崩掉,而在于额外验证工作抵消了节省的解码步数。
结论很清楚:投机解码适合低并发、低延迟场景;一旦 GPU 已被 batching 填满,它可能伤害吞吐而不是提升吞吐。
「Infra」频道最新
- SkyPilot 出山,主打碎片化 AI 算力编排 — skypilot_org · 2026-07-22
- 生产环境 AI 预算不止 token 价,还包括重试路由和可观测性 — arx-go · 2026-07-22
- NVIDIA 释出 Vera CPU 细节,押注单片式 agentic 架构 — BenBajarin · 2026-07-22
- NVIDIA 发布 Vera Rubin,称每瓦性能提升 10 倍 — nvidia · 2026-07-22
- SkyPilot 走出隐身期,主打统一分散算力 — skypilot_org · 2026-07-22
- 1GW 中国 AI 数据中心为何并非不可能 — teortaxesTex · 2026-07-22