百元级 AMD 显卡跑 Qwen 3.6 35B:优化后达 21 token/s

Sweaty_Perception655 · reddit · 2026-08-13

一位开发者在 r/LocalLLaMA 分享了使用廉价 AMD 显卡(Radeon 7600)本地运行 Qwen 3.6 35B A3B-Q80 GGUF 模型的性能表现与调优过程。

硬件与基础环境:AMD Radeon 7600 显卡,搭配 64GB DDR4 内存与 Ryzen 5600 处理器,系统为 Ubuntu,使用 llama.cpp 运行。

性能优化:通过重新编译 llama.cpp 以支持 ROCm 6.1.4,生成速度从最初的约 18 tokens/s 提升至 19+ tokens/s;随后利用 LACTL 工具将显存超频至极限,速度最终稳定在 21 tokens/s。

离奇 Bug:作者发现了一个奇怪的渲染 Bug——如果盯着 llama.cpp 生成 token 的输出界面看,速度会掉到 13 tokens/s;但把窗口最小化后,速度就能跑满 21 tokens/s。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →