单卡24GB实测:投机解码让30B模型提速至84 tok/s
iam31337 · reddit · 2026-08-12
作者在单张 RTX PRO 4000 (24GB) 上对 Muse Glimmer 30B 模型进行了 DFlash 投机解码深度测试,将代码生成速度从 17.98 提升至最高 84.64 tok/s。
核心发现与调优细节:
- 速度与接受率不成正比:Draft 4 接受率虽高(47.46%)但速度仅 34.5 tok/s;Draft 15 接受率低(17.99%)却能达到 47.20 tok/s。
- 底层优化:将 draft argmax 移出 CPU 路径并移除 llama.cpp 默认的 min-p=0.05,显著减少了热循环同步开销。
- 量化方案权衡:速度最快的 NVFP4 混合方案(94 tok/s)困惑度较差,综合表现最好的是 Q5KM。
- 极限长上下文:在填满 262K 上下文时,显存占用 22.9GB 未溢出,且解码速度仍有 21.56 tok/s。
作者总结指出,在投机解码架构下,单纯的 tok/s 或接受率都具有欺骗性,有效的基准测试必须结合工作负载分布、量化策略、草稿长度和真实的 KV 位置来综合评估。
「Infra」频道最新
- FlashRT 系统:用 AI Agent 自动优化部署,延迟降 70 倍 — BeidiChen · 2026-08-12
- ComfyUI v0.32引入全新原生注意力机制,速度媲美SageAttention — slpreme · 2026-08-12
- Google 宣布建设三条新美洲海底光缆 — rseroter · 2026-08-12
- DeepSeek V4 量化实测:修复转换隐患与 8×RTX 5090 跑分 — gladkos · 2026-08-12
- 马斯克:Starlink将承载90%以上互联网流量,卫星数近1.1万 — DimaZeniuk · 2026-08-12
- macOS虚拟化突破:Apple Silicon跑大模型速度暴增超10倍 — Scobleizer · 2026-08-12