AMD Strix Halo 上构建 llama.cpp Laguna,ROCm 仍卡在 flash-attn
dbinnunE3 · reddit · 2026-07-22
这是一篇非常具体的 本地大模型部署/编译实战记录:作者在一台 AMD Strix Halo 机器上,用 Fedora toolbox + ROCm/HIP 去构建 poolsideai/llama.cpp 的 laguna 分支,并做基准测试。
关键过程
- 在隔离的 toolbox 容器里从源码构建,而不是用现成镜像。
- 通过 GPU passthrough 让 ROCm 正常识别设备。
- 由于 Fedora 把 runtime/devel 分开,CMake 时补装了多组 -devel 包。
- 还修了一个源码问题:common/speculative.cpp 里用了 std::isfinite 但没包含 <cmath>。
实测结果
- 系统成功识别到 AMD Radeon 8060S / gfx1151。
- 在不开 flash attention、不开 KV 量化的前提下,llama-bench 跑通了。
- laguna-s-2.1-Q4KM.gguf 的结果大约是:
- pp512: 305.54 t/s
- tg128: 18.44 t/s
卡住的地方
- 开 flash attention 时,HIP kernel 报架构不兼容。
- 关闭 flash attention 后,量化 KV cache 又无法用。
- 后面尝试 DFlash 时,llama-server 也因为上下文参数问题初始化失败。
整体上,这是一篇对 AMD 本地推理栈很有参考价值的工程踩坑帖。
「编程与Agent」频道最新
- 用一个 AI 对话窗口替代四个传统 SaaS 订阅 — ahuja_priyank · 2026-07-22
- browser-search v2.0 给 agent 配了自托管浏览器栈和确定性脚本 — Ill-Tradition1362 · 2026-07-22
- 工程师用 C 重写 Transformer 引擎,发现难点在周边系统 — RelevantShape3963 · 2026-07-22
- 多智能体内容流水线输给了一个提示词和模板 — AcademicRevenue4815 · 2026-07-22
- LinkedIn 用 LangGraph 招聘智能体将面试周期缩短 60% — LangChain · 2026-07-22
- 团队把生产库权限给了 agent,现在却审计不了它们 — Alessandro_Lena_410 · 2026-07-22