4xR9700 本地跑通 Qwen:120 t/s 生成与 12k t/s 预填充
sloptimizer · reddit · 2026-08-31
用户分享了在 4 张 AMD R9700 显卡上运行 Qwen3.8-Flash-Next 模型的优化方案。通过使用 MXFP4-FP8 量化权重和定制的 vLLM Docker 镜像,实现了单请求 120 t/s 的生成速度和 12k t/s 的预填充速度。配置启用了 ROCm 优化、KV Cache FP8、前缀缓存、分块预填充以及 MTP 推测解码,并附带了完整的 Podman 启动命令。
「Infra」频道最新
- Qwen 3.8 Flash Next 实测:中端手机跑出 3.5 tok/s — dai_app · 2026-08-31
- Boring Company 招商困局:20倍成本优势却缺销售团队 — PTrubey · 2026-08-31
- 硬核实战:4080 显卡运行 182B Qwen 模型达 8 tok/s — Desperate-Data-3747 · 2026-08-31
- AI 正在改变能源系统的监控与运维方式 — ingliguori · 2026-08-31
- Uber 70% 代码由 Agent 接管,账单未涨反降 52% — alvelda · 2026-08-31
- 单核加速 29 倍但整体仅提速 10%?内存瓶颈揭示真相 — shifu_legend · 2026-08-31