官方 llama.cpp 浪费硬件,Strix Halo 优化分支解码近 60 t/s

feelspeaceman · reddit · 2026-09-08

核心问题

作者观察发现,Strix Halo(gfx1150)社区约 90% 用户在用的官方 llama.cpp 对该硬件完全未优化,实际速度难以达到硬件理论上限的一半,跑 Qwen 3.8 Flash Next 时仅约 20+ t/s decode。

三个替代方案

各方案均附有社区用户实测确认,作者推荐 Q38FN(Qwen 3.8 Flash Next)作为 Strix Halo 的首选模型。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →