Ninfer 引擎实测:5090 跑 Qwen3 27B 速度翻倍
Rollingsound514 · reddit · 2026-08-28
作者分享了使用 Ninfer 引擎在 RTX 5090 上运行 Qwen3 8 27B (nvfp4 量化) 的实测数据。据称,相比 llama.cpp,该方案将吞吐量翻倍以上,峰值速度达到 220 tokens/s,平均维持在 170 tokens/s 左右。
文中提供的具体启动参数配置包括:
- 模型:qwen3827bnvfp4.ninfer
- KV 容量:240000
- KV 类型:fp8
- 推测解码 (Speculative Decoding):开启 mtp 和 lm-head-draft,draft tokens 设为 3
- 显存分配:Host KV 设为 16GiB
- 视觉支持:开启 vision 和 media-live
作者对该项目的性能表现给予极高评价。
「Infra」频道最新
- Google/NVIDIA 联手开源项目,让 K8s 适配 LLM 推理 — SumitGup · 2026-08-28
- 国产大模型算力底座曝光:18B 激活 MoE 训练 30T token — teortaxesTex · 2026-08-28
- 澳洲能源部长:数据中心无化石燃料豁免权 — nordicinst · 2026-08-28
- ZED 相机卖 500 美元?网友自制方案成本仅 150 美元 — _William_F_ · 2026-08-28
- KOTOR 重制版路径追踪渲染器集成了 DLSS 4.5 — Michael_Moroz_ · 2026-08-28
- 教树莓派用神经网络自动读燃气表,完全自动化抄表 — JeremyCMorgan · 2026-08-28