双 5070 Ti 跑 Qwen3.8-27B:三引擎实测,vLLM 一个 flag 差 11 倍
puthre · reddit · 2026-09-05
作者在 2× RTX 5070 Ti 16GB(Blackwell,无 P2P)上实测 Qwen3.8-27B 的三种推理引擎,并给出完整启动命令。
- TL;DR:llama.cpp(Q4KXL,17.6GB)MTP3 投机解码下 115 tok/s、最大上下文 220k;vLLM(NVFP4,21GB)约 110 tok/s、122k;NInfer(NVFP4)约 100 tok/s 但支持完整 262k 原生上下文。
- 最大教训:vLLM 在 Blackwell 上加 --enforce-eager 会从 110 tok/s 暴跌到 9.6 tok/s,一个 flag 差 11 倍。
- 关键配置:vLLM 需 --max-cudagraph-capture-size 4、--kv-cache-memory、--disable-custom-all-reduce 等一系列适配 16GB 双卡的 flag;llama.cpp 需 q80 KV cache 才能到 220k 上下文,MTP3 接受率 65%,8k 到 131k 上下文均稳定 110 tok/s。
- 硬件细节:PCIe 4.0 x8/x8 bifurcation,无 P2P,主机中转通信。
- 结论:三引擎速度接近,真正差别在上下文长度与配置复杂度;NInfer 虽只标注支持 5090,在 5070 Ti 上无需修改即可运行。
「Infra」频道最新
- Wan2GP 桌面启动器 Tauri 版:一键装好开源视频生成全家桶 — Extension_Affect_483 · 2026-09-05
- 把 NVIDIA DLSS 5 神经渲染器搬上 Mac:开源项目实测精度几乎无损 — WaveCut · 2026-09-05
- ESP32 语音助手实战:AIMET 量化把唤醒词模型压缩 8 倍 — carrycooldude · 2026-09-05
- 开发者优化 GLM 5.2 在 B300 上的推理速度,并替换 Claude Code 中的 Anthropic 模型 — abhijithneil · 2026-09-05
- LLM 推理从 MVP 到生产:什么逼你换掉整套技术栈 — Ok_Philosophy_4031 · 2026-09-05
- 爆料称 GPT-6 Astra 元提示能力远胜 Claude Fable 5.1 — whoiskatrin · 2026-09-05