AMD R9700 跑 NVFP4 Qwen3.8 27B:5809 tok/s 预填充

whodoneit1 · reddit · 2026-09-16

开发者在其基于 Radiance 镜像的 vLLM MXFP4 构建上新增了 NVFP4 到 MXFP4 的在线转换,充分利用 AMD R9700 的 MXFP4 快速路径,让任何 NVFP4 量化模型在 AMD 硬件上大幅提速。

实测 NVFP4 量化的 Qwen3.8-27B(Unsloth Dynamic v3)达到约 5,809 tok/s 预填充(prefill)和 276 tok/s 解码。项目代码开源于 Codeberg 和 GitHub,性能数据由自研 BetterBench 工具测量。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →