百元级 AMD 显卡跑 Qwen 3.6 35B:优化后达 21 token/s
Sweaty_Perception655 · reddit · 2026-08-13
一位开发者在 r/LocalLLaMA 分享了使用廉价 AMD 显卡(Radeon 7600)本地运行 Qwen 3.6 35B A3B-Q80 GGUF 模型的性能表现与调优过程。
硬件与基础环境:AMD Radeon 7600 显卡,搭配 64GB DDR4 内存与 Ryzen 5600 处理器,系统为 Ubuntu,使用 llama.cpp 运行。
性能优化:通过重新编译 llama.cpp 以支持 ROCm 6.1.4,生成速度从最初的约 18 tokens/s 提升至 19+ tokens/s;随后利用 LACTL 工具将显存超频至极限,速度最终稳定在 21 tokens/s。
离奇 Bug:作者发现了一个奇怪的渲染 Bug——如果盯着 llama.cpp 生成 token 的输出界面看,速度会掉到 13 tokens/s;但把窗口最小化后,速度就能跑满 21 tokens/s。
「Infra」频道最新
- 微软自研 AI 芯片项目缓慢起步后显露生机 — pstAsiatech · 2026-08-13
- 英伟达为何发力打造全球最佳开源 AI 模型 — pstAsiatech · 2026-08-13
- 巧用上下文缓存,单月省下 4 万美元 API 费用 — NathanWilbanks_ · 2026-08-13
- LTX-Video 本地实测:RTX 5060 生成 30 秒视频耗时 7 分钟 — Character_Title_876 · 2026-08-13
- CoreWeave盈利超预期拉动AI算力信心,量子计算或迎双头垄断 — TiernanRayTech · 2026-08-13
- ComfyUI 双显卡部署踩坑:第二张 GPU 导致显存溢出 — tricck3zz · 2026-08-13