网友自调 vLLM 配方:Qwen3.8 Flash Next NVFP4 量化跑通 RTX Pro 5000

knob-0u812 · reddit · 2026-09-26

作者在 RTX Pro 5000 72GB 上找不到现成的 Qwen3.8 Flash Next NVFP4 部署配方,于是参考 Hermes 和 Unsloth 的 4-bit 量化,用 PLE offloading 搭出 vLLM 配方(TP=2),已稳定运行一周。完整配置开源在 GitHub。

所属事件:开发者自研 RTX Pro 5000 上跑 Qwen 量化模型的 vLLM 配方(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →