Qwen3.8-27B 在 AMD Strix Halo 上跑出 31t/s

stereohype · reddit · 2026-08-20

在搭载 Ryzen AI Max+ 395 和 Radeon 8060S 的设备上,作者通过 DFlash2 推测解码方案和 Vulkan 后端,成功让 Qwen3.8-27B (Q5KXL) 在 80W 功耗下达到 31.4 t/s 的解码速度,预填充速度约 300 t/s。实测表明,DFlash2 比内置 MTP 快 40%,且在此配置下 Q5 量化比 Q4 更快(因更高的接受率抵消了带宽开销)。文章提供了完整的启动命令和优化建议。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →