RTX 5090 跑 30B 模型达 253 t/s,投机解码优化实测

patricious · reddit · 2026-08-11

作者在 RTX 5090(32GB)上对 Muse Glimmer 30B(Q5KM 量化)模型进行了推理基准测试。通过应用将 DFlash 草稿 argmax 从 CPU 转移到 GPU 的 PR #26842,成功突破了性能瓶颈。

优化后,代码生成任务的推理速度从 78 t/s 跃升至 220-253 t/s,混合智能体任务也提升至 188-213 t/s。作者还提供了详细的启动参数配置,并指出当前推理预算标志在该模板下不生效等注意事项。

所属事件:RTX 5090 实测跑 30B 模型推理速度超 233 tps(3 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →