投机解码让 Qwen3.6-27B 在单卡上起飞,高并发却会拖慢服务器
luke_pacman · reddit · 2026-07-21
这篇实测对 Unsloth 的 Qwen3.6-27B NVFP4 做了单卡和双卡 RTX 5090 测试,结论是:投机解码(speculative decoding)在空闲场景下很有用,但在高并发下可能反而拖慢服务器。
关键结果:
- 在 1 张 RTX 5090 上,nspec=3 把 decode 速度从 66 tok/s 提升到 120 tok/s。
- 在 2 张 RTX 5090 上,同样设置只到 108 tok/s,相比无 MTP 的 99 tok/s 提升很有限。
- 一旦进入批处理场景,收益迅速衰减:8 并发时只剩 +5%,到 12–16 并发时反而变成 22–37% 的降速。
- 通过率大致稳定在 71–73%,说明问题不在于接受率崩掉,而在于额外验证工作抵消了节省的解码步数。
结论很清楚:投机解码适合低并发、低延迟场景;一旦 GPU 已被 batching 填满,它可能伤害吞吐而不是提升吞吐。
「Infra」频道最新
- NVIDIA 称 Nemotron 3 Ultra 在 RTL 芯片设计任务上达 97.1% — NVIDIAAI · 2026-07-27
- 本地 Qwen 模型驱动机械臂测试 78 款手机续航 — gappyvalley · 2026-07-27
- MiniBot 2.40 新增 xAI、HF Studio 和 vLLM 支持 — Creative-Type9411 · 2026-07-27
- 苹果智能眼镜、英伟达SK合作与携程51.79亿罚单汇总 — APPSO · 2026-07-27
- DeepSeek 融资传闻、欧盟 AI 透明度规则与 OpenAI 安全事故 — 创业邦 · 2026-07-27
- QuixiCore 主张原生量化内核取代先反量化再执行 — QuixiAI · 2026-07-27