4xR9700 本地跑通 Qwen:120 t/s 生成与 12k t/s 预填充

sloptimizer · reddit · 2026-08-31

用户分享了在 4 张 AMD R9700 显卡上运行 Qwen3.8-Flash-Next 模型的优化方案。通过使用 MXFP4-FP8 量化权重和定制的 vLLM Docker 镜像,实现了单请求 120 t/s 的生成速度和 12k t/s 的预填充速度。配置启用了 ROCm 优化、KV Cache FP8、前缀缓存、分块预填充以及 MTP 推测解码,并附带了完整的 Podman 启动命令。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →