单卡 5090 跑 Qwen 27B:200+ t/s 推理实战
Maleficent-Ad5999 · reddit · 2026-08-31
用户在单张 RTX 5090 (32GB) 上成功运行 Qwen3.8-27B 模型 (NVFP4 量化),使用 ninfer 引擎实现了 200+ t/s 的解码速度。实测数据显示,在 180K 上下文且开启 MTP (5 draft tokens) 时,解码速度达 200.5 tok/s。作者提供了具体的启动命令和基准测试结果,指出合成文本预测较容易,真实 Agent 编码场景下接受率约 51%,速度降至 154 tok/s。
「Infra」频道最新
- Qwen 3.8 Flash Next 实测:中端手机跑出 3.5 tok/s — dai_app · 2026-08-31
- Boring Company 招商困局:20倍成本优势却缺销售团队 — PTrubey · 2026-08-31
- 硬核实战:4080 显卡运行 182B Qwen 模型达 8 tok/s — Desperate-Data-3747 · 2026-08-31
- AI 正在改变能源系统的监控与运维方式 — ingliguori · 2026-08-31
- Uber 70% 代码由 Agent 接管,账单未涨反降 52% — alvelda · 2026-08-31
- 单核加速 29 倍但整体仅提速 10%?内存瓶颈揭示真相 — shifu_legend · 2026-08-31