Ninfer 在 Blackwell 上实测 130-180 t/s,远快于 llama-server

swagonflyyyy · reddit · 2026-10-02

Reddit 用户在 Blackwell MaxQ GPU 上实测新推理后端 Ninfer(qwen3.8-27b-nvfp4,Dflash2、MTP-7 配置):速度达 130-180 tokens/s,并行解码几乎无衰减,并发能力媲美 vLLM。作者花一下午将其装在 Windows 10 上并从 llama-server 迁移,称其高度专业化、特别适合 agent 式 vibe coding。目前仍缺高级采样参数和更广模型支持,但作者已认可其日常可用性。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →