Llama.cpp 配 ROCm 在 780M 上狂崩,一个环境变量救回来

MaximusSenior · reddit · 2026-08-27

在 Radeon 780M 核显上用 llama.cpp + ROCm 7.14 跑 Qwen 3,作者发现小 prompt 预处理速度可达 200-300 t/s(Vulkan 仅约 60 t/s),但会频繁崩溃。

定位到 ROCm 上游已知 issue 后, workaround 是设置环境变量 AMDSERIALIZEKERNEL=3:稳定性大幅改善,代价是预处理降到约 100 t/s,但仍快于 Vulkan。作者询问其他在 780M 或类似核显上用 ROCm 的用户是否有相同问题或更好解法。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →