网友自调 vLLM 配方:Qwen3.8 Flash Next NVFP4 量化跑通 RTX Pro 5000
knob-0u812 · reddit · 2026-09-26
作者在 RTX Pro 5000 72GB 上找不到现成的 Qwen3.8 Flash Next NVFP4 部署配方,于是参考 Hermes 和 Unsloth 的 4-bit 量化,用 PLE offloading 搭出 vLLM 配方(TP=2),已稳定运行一周。完整配置开源在 GitHub。
所属事件:开发者自研 RTX Pro 5000 上跑 Qwen 量化模型的 vLLM 配方(2 条相关)→
「Infra」频道最新
- CUMEC 发布 8 英寸硅光异构集成薄膜铌酸锂晶圆细节 — jwt0625 · 2026-09-26
- Apollo:AI 支出前 10% 客户占模型服务开销 99.5%,超大规模资本开支一年上调 7500 亿美元 — rohanpaul_ai · 2026-09-26
- 爆料:Fal 洽谈按 150 亿美元估值融资,Fireworks 拟冲 300 亿 — steph_palazzolo · 2026-09-26
- Crusoe 放弃 12.5 亿美元 Boom 燃气轮机 AI 数据中心供电计划 — TechCrunch AI · 2026-09-26
- 六大超大规模厂商 2026-27 资本开支上调约 7500 亿美元 — rohanpaul_ai · 2026-09-26
- OpenRouter 日处理超 10 万亿 token,详解多模型分发生意与 token 欺诈 — Latent Space · 2026-09-26