投机解码让 Qwen3.6-27B 在单卡上起飞,高并发却会拖慢服务器
luke_pacman · reddit · 2026-07-21
这篇实测对 Unsloth 的 Qwen3.6-27B NVFP4 做了单卡和双卡 RTX 5090 测试,结论是:投机解码(speculative decoding)在空闲场景下很有用,但在高并发下可能反而拖慢服务器。
关键结果:
- 在 1 张 RTX 5090 上,nspec=3 把 decode 速度从 66 tok/s 提升到 120 tok/s。
- 在 2 张 RTX 5090 上,同样设置只到 108 tok/s,相比无 MTP 的 99 tok/s 提升很有限。
- 一旦进入批处理场景,收益迅速衰减:8 并发时只剩 +5%,到 12–16 并发时反而变成 22–37% 的降速。
- 通过率大致稳定在 71–73%,说明问题不在于接受率崩掉,而在于额外验证工作抵消了节省的解码步数。
结论很清楚:投机解码适合低并发、低延迟场景;一旦 GPU 已被 batching 填满,它可能伤害吞吐而不是提升吞吐。
「Infra」频道最新
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11