一个驱动开关让 AMD 双卡 Vulkan 推理提速最高 4 倍
tabletuser_blogspot · reddit · 2026-09-28
Reddit 用户在双 Radeon GPU(MI50 16GB + RX 7900 GRE)上跑 llama.cpp Vulkan 后端时发现性能偏低,排查后总结出一套本地推理优化方法:
- 硬件布局:把 MI50 移到主 PCIe 16x 槽、RX 7900 GRE 降到 4x 槽,整体推理性能提升。
- 关键开关:RADVPERFTEST=nogttspill——AMD Linux 驱动旗标,强制 Mesa RADV Vulkan 驱动把模型分配保留在显存内、不溢出到系统内存(GTT)。
- 实测结果:多款 GGUF 模型的 pp512 提升显著,最高 +402%(Laguna-XS-2.1),gemma-4-31B 约 +398%,Muse-Glimmer-30B +387% 且 tg128 +48.6%;但部分 MoE 模型(如 Qwen3-Coder-30B-A3B)反而略有下降。
- 作者还用 Google Gemini 协助优化 llama-bench 参数,并给出了完整命令与 13 个模型的基准数据表。
对用 AMD 卡本地跑大模型的用户,这个开关值得立刻试。
「Infra」频道最新
- AI agent 三天重写推理引擎,让 27B 模型在 Mac 上从 66 提速到 580 tok/s — a300a300 · 2026-09-28
- Fireworks 推理平台后训练 Kimi K3,同质量省 40% 成本 — isidentical · 2026-09-28
- PrismML 三值压缩 Qwen3.8 27B 至 5.9GB,能力保留 98.2% — dl_weekly · 2026-09-28
- 开发者拟让 Codex 决定跑哪些测试,大幅削减 CI 成本 — sull · 2026-09-28
- 免费在线 LLM 原理全指南:从 token 到本地部署全链路 — JFPuget · 2026-09-28
- 向量数据库够用吗?Reddit 热议 Agent 生产级存储难题 — OkShirt9372 · 2026-09-28