RTX 5090 跑 30B 模型达 253 t/s,投机解码优化实测
patricious · reddit · 2026-08-11
作者在 RTX 5090(32GB)上对 Muse Glimmer 30B(Q5KM 量化)模型进行了推理基准测试。通过应用将 DFlash 草稿 argmax 从 CPU 转移到 GPU 的 PR #26842,成功突破了性能瓶颈。
优化后,代码生成任务的推理速度从 78 t/s 跃升至 220-253 t/s,混合智能体任务也提升至 188-213 t/s。作者还提供了详细的启动参数配置,并指出当前推理预算标志在该模板下不生效等注意事项。
所属事件:RTX 5090 实测跑 30B 模型推理速度超 233 tps(3 条相关)→
「Infra」频道最新
- 港大团队突破冯·诺依曼瓶颈,研发极低能耗二维材料 AI 芯片 — YiMaTweets · 2026-08-11
- Blockstream推出原子交换服务,应对AI辅助攻击潮 — RSync25 · 2026-08-11
- RTX 3060 Ti 也能本地跑视频生成:20 分钟出片,8GB 显存够用 — cocktailpeanut · 2026-08-11
- 单卡 RTX 5080 跑 35B 模型:从 llama.cpp 迁移至 vLLM 指南 — McFlurriez · 2026-08-11
- SlimServe 开源:4 张 A100 跑 DeepSeek 并发吞吐量破千 — QuixiAI · 2026-08-11
- Qwen 3 30B本地推理破千,Apple端侧AI硬件优势凸显 — StefanoGogioso · 2026-08-11