4 张 RTX 5060 Ti 跑 vLLM 的 NVFP4 修复与调参记录
see_spot_ruminate · reddit · 2026-07-29
这是一条很实操的 vLLM / NVFP4 本地推理调优笔记,作者在 4 张 RTX 5060 Ti 上跑 unsloth/Qwen3.6-27B-NVFP4,并给出了可复现的 OOM 解决方案。
- 他们遇到的 vLLM #46268 启动 OOM,可以通过在 systemd 里同时设置 MAXJOBS=4 和 NVCCTHREADS=4 解决;代价是启动更慢,但能避免 NVFP4 checkpoint 的报错。
- 之后又围绕单并发吞吐做了调参:gpumemoryutilization=0.60、MTP speculative decoding 设为 5、限制上下文与 batch,最终在这套消费级多卡机器上跑到约 70–80 tok/s 的生成速度和 2000+ tok/s 的 prefill。
「Infra」频道最新
- LiveKit 称 Gemma 4 31B 语音首 token 仅 192 毫秒 — GlennCameronjr · 2026-07-30
- Project Orion 称 Orion-16B 在超半数节点掉线后仍继续训练 — bittingthembits · 2026-07-30
- Qwen Image 2512 优化版:体积缩小5倍,推理提速3倍 — enrique-byteshape · 2026-07-30
- Reddit 用户在双 5090 家庭主机上跑出 Kimi K3 约 4 t/s — iVoider · 2026-07-30
- AI算力概念股遇冷:CRWV创52周新低,英伟达三月跌近9% — GaryMarcus · 2026-07-30
- 双 RTX 3090 仍难同时装下 Qwen 图像编辑和 27B 文本模型 — Civil_Fee_7862 · 2026-07-30