AMD Strix Halo 跑 Qwen3.8 27B:作者开源完整优化方案
ilintar · reddit · 2026-09-05
一位受 AMD 工程师之邀参与 Lemonade 项目的开发者,发布了在 Strix Halo 上优化 llama.cpp 运行 Qwen3.8 27B 的完整方案(pwilkin.github.io/strix-halo)。要点:
- 主线 llama.cpp 的 ROCm 支持目前因统一内存访问 PR 未合而损坏,作者在自己的 strix-halo 分支合并了环形缓冲区修复与 TOP-K 优化 PR。
- 当前 ROCm 有 graph 更新极慢的 bug,作者提交了修复 PR,落地前必须自编译 .so。
- 受 Redline 库启发,作者魔改 ROCm HIP 库实现更底层的 PM4 调度,dispatch-bound 模型可提升 20% 解码速度;但 Qwen3.8 27B 在 Strix 上是带宽瓶颈,收益有限。
- 实测否定了 ROCmFP4 格式:Strix Halo 无原生 FP4 支持,其量化质量劣于主流 4-bit 方案;作者改为将大张量统一量化为 IQ4XS,质量与内核性能双优。
- 基础解码上限约 15 t/s(带宽瓶颈),真正的提速关键是用 IQ4XS 量化的 DFlash2 投机解码,速度更快且接受率几乎不变。
所有优化打包为一键安装,供 Strix Halo 用户直接使用。
「Infra」频道最新
- 本地 124B 模型写出 agent 专用限时免密 sudo 工具并开源 — max_paperclips · 2026-09-05
- Experiential Labs 开源网关一把钥匙接入 1000+ 模型,零加价 — Shruti_0810 · 2026-09-05
- 三张 5060 Ti 本地跑 27B 模型:一套 MoA 工作流的真实体验账 — Then_Blueberry7290 · 2026-09-05
- 黄仁勋:1GW 数据中心成本 500-600 亿美元,本十年要建 100GW — victor_explore · 2026-09-05
- 开源无头浏览器 Lightpanda:比 Chrome 快 11 倍、省 9 倍内存 — JafarNajafov · 2026-09-05
- 腾讯混元 Hy4 预览版:770B 参数、1M 上下文、Apache 2.0 开源 — Aiden_Tech_Ai · 2026-09-05