RTX 5090 实测:NInfer、llama.cpp、vLLM 质量持平速度见分晓
bengizmoed · reddit · 2026-09-05
作者为生产环境内容智能管线在单卡 RTX 5090(32GB,eGPU 扩展坞)上对比 Qwen3.8-27B 的三种推理方案:llama.cpp(Q5KM GGUF)、vLLM 与 NInfer(均 NVFP4)。
测试方法
- 自建 6 层评测、每层 50 项,全部来自真实生产工作负载:相关性分类、64K-240K 上下文针取回、120K+ 多转写稿 QA(含不可答对照)、开思考推理、结构化抽取(mode)、agent 工具回放
- 同提示词、同种子(42)、同金标,配对聚类 bootstrap 置信区间,预注册非劣性边界
- 中途请 Codex/GPT-5、DeepSeek V4 Pro、Grok 4.5、Kimi K3 四模型组成评审团审计方法论,发现 10 个问题(含 4 处金标标错),修正后重跑
质量结论
- 三引擎质量在统计上不可区分;针取回均 100%,推理约 100%,转写 QA 在 78%-88% 间
- NInfer 取回得分优势完全来自 240K 上下文容量(llama.cpp 196K 装不下 192K 项),非检索质量差异
- 工具回放三个引擎全挂
配置与速度
- NInfer MTP3 接受率 76%,支持 x2 并发;vLLM 连续批处理;llama.cpp 仅 parallel=1
- 三者 VRAM 占用均在 29.6-31.6GB
结论:质量无差,选择取决于并发与上下文需求,NInfer 兼顾两者。
「Infra」频道最新
- 19 个延迟优化模式:模型之外的 AI 应用提速路线图 — bibryam · 2026-09-05
- 曝 OpenAI Astra 动用 10 万枚 GPU 训练,算力规模惊人 — sudoraohacker · 2026-09-05
- 爆料称 GPT-6 仅用 10 万块 B200/300 在德州单基地训练完成 — round · 2026-09-05
- gfx906 fork 让 MI50 等老卡跑 LLM:预填充提速 23%,40GB 塞下 250k 上下文 — milpster · 2026-09-05
- Generalist AI 筹集超 50 万小时真机数据,借 Robinhood 链上发数据赏金 — broodsugar · 2026-09-05
- Omagrid P2P 算力网上线,Omarchy 机器直接共享 DeepSeek 与 Qwen — dee_hw · 2026-09-05