Ninfer 引擎实测:5090 跑 Qwen3 27B 速度翻倍

Rollingsound514 · reddit · 2026-08-28

作者分享了使用 Ninfer 引擎在 RTX 5090 上运行 Qwen3 8 27B (nvfp4 量化) 的实测数据。据称,相比 llama.cpp,该方案将吞吐量翻倍以上,峰值速度达到 220 tokens/s,平均维持在 170 tokens/s 左右。

文中提供的具体启动参数配置包括:

作者对该项目的性能表现给予极高评价。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →