Llama.cpp 配 ROCm 在 780M 上狂崩,一个环境变量救回来
MaximusSenior · reddit · 2026-08-27
在 Radeon 780M 核显上用 llama.cpp + ROCm 7.14 跑 Qwen 3,作者发现小 prompt 预处理速度可达 200-300 t/s(Vulkan 仅约 60 t/s),但会频繁崩溃。
定位到 ROCm 上游已知 issue 后, workaround 是设置环境变量 AMDSERIALIZEKERNEL=3:稳定性大幅改善,代价是预处理降到约 100 t/s,但仍快于 Vulkan。作者询问其他在 780M 或类似核显上用 ROCm 的用户是否有相同问题或更好解法。
「Infra」频道最新
- 呼吁社区推广 LoRA 分发以节省下载带宽 — Borkato · 2026-08-27
- GLM-5.3-Flash 本地部署实测:206 tok/s 与 1M 上下文 — funding__secured · 2026-08-27
- Hugging Face 推出 Jobs:按秒计费跑 UV/Docker 任务 — _akhaliq · 2026-08-27
- Merge 联合 PostHog 举办 NYC 技术沙龙,探讨自驱动产品 — shensi · 2026-08-27
- LightningAI 推出即时 H100 租赁,无需等待排队 — LightningAI · 2026-08-27
- M7 Ultra 或搭载原生 FP8,GLM 5.3-flash 性能有望飞跃 — Brilliant-Hall1387 · 2026-08-27