四卡 4090 本地跑模型:vLLM+P2P 补丁还是 llama.cpp 选谁
dowitex · reddit · 2026-09-07
网友用 4 张 RTX 4090 + 线程撕裂者主板搭建本地编码用推理机,在两套方案间纠结:① vLLM 跑 Qwen 3.8 27B dense(fp8+256K KV cache),配合开源 NVIDIA 驱动的 P2P 补丁提升多卡通信,但无 4bit 量化且 fp8 显存吃紧;② llama.cpp 跑 Qwen flash next MoE 的 iq4xs 量化 + 8bit cache 200K KV cache。P2P 补丁只对 vLLM 有效。作者询问 Qwen flash next 的智能提升是否值得牺牲 vLLM 的更高吞吐。
「Infra」频道最新
- Merge Gateway 推出 DeepSeek V4 Flash 七五折:输入每百万 token 仅 4 美分 — shensi · 2026-09-07
- 「自托管 AI」的神话:本地模型仍绕不开云在环 — nomad-nostalgia · 2026-09-07
- AI 能否完全跑在手机上?端侧推理或颠覆 OpenAI 的收费模式 — kevinsurace · 2026-09-07
- 推理工程被严重低估:从 KV Cache 到 p99 延迟的完整技术版图 — techNmak · 2026-09-07
- Polymarket:年内有州通过数据中心禁令的概率达 73% — Polymarket · 2026-09-07
- 路州一家塔可店 40% 月营业额竟来自 Meta AI 数据中心 — Polymarket · 2026-09-07