开发者自研 RTX Pro 5000 上跑 Qwen 量化模型的 vLLM 配方
由于在 RTX Pro 5000 72GB 显卡上找不到现成的 Qwen3.8 Flash Next NVFP4 部署方案,开发者参考 Hermes 与 Unsloth 的 4-bit 量化做法,自行调配 vLLM 配方并成功跑通该模型,相关经验在社区内引发关注与传播。
2026-09-26 ~ 2026-09-26 · 2 条相关
- RTX Pro 5000 72G 上跑 Qwen3.8 Flash Next NVFP4 的 vLLM 配方 — knob-0u812 · 2026-09-26
另有 1 条近重复转述:knob-0u812