官方 llama.cpp 浪费硬件,Strix Halo 优化分支解码近 60 t/s
feelspeaceman · reddit · 2026-09-08
核心问题
作者观察发现,Strix Halo(gfx1150)社区约 90% 用户在用的官方 llama.cpp 对该硬件完全未优化,实际速度难以达到硬件理论上限的一半,跑 Qwen 3.8 Flash Next 时仅约 20+ t/s decode。
三个替代方案
- halogen-flash-server(peonist-ai):专为 Strix Halo 与 Q38FN 优化,实测约 50 t/s decode、1200 t/s prefill,作者称其为「Ninfer for Strix Halo」
- myhacsint 的 llama.cpp 实验分支(strix-halo-qwen4exp):约 60 t/s decode、600 t/s prefill
- halo-box/strix-llama.cpp:约 30 t/s decode、800 t/s prefill,是 r/StrixHalo 社区持续更新并带 Discord 的首个 fork,最新提交大幅提升了 prefill 速度
各方案均附有社区用户实测确认,作者推荐 Q38FN(Qwen 3.8 Flash Next)作为 Strix Halo 的首选模型。
「Infra」频道最新
- 大型科技公司选址阿根廷巴塔哥尼亚,拟建超大数据中心 — Polymarket · 2026-09-08
- TimesFM 3.0 新增 MLX 后端:苹果芯片原生跑时序预测,M4 Max 每秒 641 序列 — rachittshah · 2026-09-08
- 数据中心建设拉动货运:7月Cass指数跌4.5%却掩盖了真实需求 — kernelangus420 · 2026-09-08
- AMD 桌面 AI 工作站内存 2.6TB,达 NVIDIA DGX Station 三倍多 — shashib · 2026-09-08
- Minecraft 创始人吐槽:AI 服务该允许付费直接开高配 VM — DavidSHolz · 2026-09-08
- 7×24 小时跑 agent 集群,崩溃元凶不是 prompt 而是系统工程 — ParrotIntegrated · 2026-09-08