Ninfer 在 Blackwell 上实测 130-180 t/s,远快于 llama-server
swagonflyyyy · reddit · 2026-10-02
Reddit 用户在 Blackwell MaxQ GPU 上实测新推理后端 Ninfer(qwen3.8-27b-nvfp4,Dflash2、MTP-7 配置):速度达 130-180 tokens/s,并行解码几乎无衰减,并发能力媲美 vLLM。作者花一下午将其装在 Windows 10 上并从 llama-server 迁移,称其高度专业化、特别适合 agent 式 vibe coding。目前仍缺高级采样参数和更广模型支持,但作者已认可其日常可用性。
「Infra」频道最新
- DGX Spark 被 Linux 隐藏 4.1 GiB 内存,两个技巧找回 — marian_nmt · 2026-10-02
- 断网医院里本地模型成救命工具:24GB 内存可跑 Qwen3-4bit — AaronBergman18 · 2026-10-02
- TensorFold 0.6.1 上线 DGX Spark 性能大增:8 流提速 36% — EAccelerate_42 · 2026-10-02
- 开源权重模型落后闭源仅 4 个月,适用边界在哪里 — TechPreacher · 2026-10-02
- 谷歌首颗太空算力原型卫星随 SpaceX 发射成功 — elonmusk · 2026-10-02
- 别再租用 AI 记忆:Qdrant Edge 离线演示 15MB 端侧亚毫秒向量检索 — AI Engineer · 2026-10-02