实测 5090 跑 Qwen3.8 27B:ninfer 达 147 t/s,胜过 llama.cpp
theexile1337 · reddit · 2026-10-03
- 作者在 RTX 5090 上用 120k 上下文、thinking xhigh 固定 prompt,对比 ninfer 与 llama.cpp 四种配置运行 Qwen3.8 27B,并以约 2400 次随机射击脚本检验生成台球游戏的规则正确性。
- 速度:non-NVFP4 ninfer+MTP 约 147 t/s(7m40s),llama.cpp 开启 MTP 后从 68 t/s 跳到 141 t/s,接近 ninfer——「ninfer 快」很大程度是「MTP 快」。NVFP4 t/s 最高(约 155)但思考 token 最多,墙钟时间只排第三。
- 质量:四版游戏都能跑通,但只有 ninfer NVFP4 版能合法获胜,其余三版在胜利条件上有逻辑 bug(如清完球打进 8 号被判犯规),其中一个 bug 只是一行取反检查。
- 注意事项:每配置仅跑一次;NVFP4 与 Q4KM 量化方案不同,不能直接等价比较。作者最终选择 non-NVFP4 ninfer 版,认为其打磨最好(有音效、开球规则正确)。
「Infra」频道最新
- DGX Spark 一货难求:筹款 8800 美元捐机计划因缺货濒临流产 — cyrus_zei · 2026-10-03
- Perplexity 宣布绑定 NVIDIA Vera CPU,自建沙盒推 Perplexity Computer — AravSrinivas · 2026-10-03
- 用户算账:ChatGPT 白跑 30 分钟算力才报限额,单次约浪费 3-5 美元 — CautiousMagazine3591 · 2026-10-03
- AirLLM 靠分层流式加载,让 70B 模型跑进 4GB 显存 — techNmak · 2026-10-03
- GPU 是不是印钞机?SemiAnalysis 拆解推理经济与 Vera Rubin vs Blackwell — AccBalanced · 2026-10-03
- gufo 推出 Windows 免编译包,Strix Halo 用户开箱即用跑本地大模型 — hiImMate · 2026-10-03