RTX Pro 5000 72G 上跑 Qwen3.8 Flash Next NVFP4 的 vLLM 配方
knob-0u812 · reddit · 2026-09-26
作者在 RTX Pro 5000 72GB 上找不到现成的 Qwen3.8 Flash Next 部署方案,于是基于 Hermes 和 Unsloth 的 4-bit 量化,自己捣鼓出一份 NVFP4 量化配 PLE offloading 的 vLLM 配方。
作者已用这套配置稳定运行约一周,应对各种负载表现良好,配方发布在 GitHub 仓库 qwen38-flashnext-nvfp4-sm120,欢迎批评指正。适合想在 72GB 显卡上本地部署该大参数量化模型的用户参考。
所属事件:开发者自研 RTX Pro 5000 上跑 Qwen 量化模型的 vLLM 配方(2 条相关)→
「Infra」频道最新
- e/acc 玩家在地下室自建 GPU 集群跑推理,险些把房子点着 — beffjezos · 2026-09-26
- SF Compute:先啃物理结算层,才有资格做算力市场 — hardimanjames · 2026-09-26
- CUMEC 发布 8 英寸硅光异构集成薄膜铌酸锂晶圆细节 — jwt0625 · 2026-09-26
- Apollo:AI 支出前 10% 客户占模型服务开销 99.5%,超大规模资本开支一年上调 7500 亿美元 — rohanpaul_ai · 2026-09-26
- 爆料:Fal 洽谈按 150 亿美元估值融资,Fireworks 拟冲 300 亿 — steph_palazzolo · 2026-09-26
- Crusoe 放弃 12.5 亿美元 Boom 燃气轮机 AI 数据中心供电计划 — TechCrunch AI · 2026-09-26