RTX Pro 5000 72G 上跑 Qwen3.8 Flash Next NVFP4 的 vLLM 配方

knob-0u812 · reddit · 2026-09-26

作者在 RTX Pro 5000 72GB 上找不到现成的 Qwen3.8 Flash Next 部署方案,于是基于 Hermes 和 Unsloth 的 4-bit 量化,自己捣鼓出一份 NVFP4 量化配 PLE offloading 的 vLLM 配方。

作者已用这套配置稳定运行约一周,应对各种负载表现良好,配方发布在 GitHub 仓库 qwen38-flashnext-nvfp4-sm120,欢迎批评指正。适合想在 72GB 显卡上本地部署该大参数量化模型的用户参考。

所属事件:开发者自研 RTX Pro 5000 上跑 Qwen 量化模型的 vLLM 配方(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →