RTX 5090 实测:NInfer、llama.cpp、vLLM 质量持平速度见分晓

bengizmoed · reddit · 2026-09-05

作者为生产环境内容智能管线在单卡 RTX 5090(32GB,eGPU 扩展坞)上对比 Qwen3.8-27B 的三种推理方案:llama.cpp(Q5KM GGUF)、vLLM 与 NInfer(均 NVFP4)。

测试方法

质量结论

配置与速度

结论:质量无差,选择取决于并发与上下文需求,NInfer 兼顾两者。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →