四卡 4090 本地跑模型:vLLM+P2P 补丁还是 llama.cpp 选谁

dowitex · reddit · 2026-09-07

网友用 4 张 RTX 4090 + 线程撕裂者主板搭建本地编码用推理机,在两套方案间纠结:① vLLM 跑 Qwen 3.8 27B dense(fp8+256K KV cache),配合开源 NVIDIA 驱动的 P2P 补丁提升多卡通信,但无 4bit 量化且 fp8 显存吃紧;② llama.cpp 跑 Qwen flash next MoE 的 iq4xs 量化 + 8bit cache 200K KV cache。P2P 补丁只对 vLLM 有效。作者询问 Qwen flash next 的智能提升是否值得牺牲 vLLM 的更高吞吐。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →