开发者自研 RTX Pro 5000 上跑 Qwen 量化模型的 vLLM 配方

由于在 RTX Pro 5000 72GB 显卡上找不到现成的 Qwen3.8 Flash Next NVFP4 部署方案,开发者参考 Hermes 与 Unsloth 的 4-bit 量化做法,自行调配 vLLM 配方并成功跑通该模型,相关经验在社区内引发关注与传播。

2026-09-26 ~ 2026-09-26 · 2 条相关

另有 1 条近重复转述:knob-0u812