单卡24GB实测:投机解码让30B模型提速至84 tok/s

iam31337 · reddit · 2026-08-12

作者在单张 RTX PRO 4000 (24GB) 上对 Muse Glimmer 30B 模型进行了 DFlash 投机解码深度测试,将代码生成速度从 17.98 提升至最高 84.64 tok/s。

核心发现与调优细节:

作者总结指出,在投机解码架构下,单纯的 tok/s 或接受率都具有欺骗性,有效的基准测试必须结合工作负载分布、量化策略、草稿长度和真实的 KV 位置来综合评估。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →