140 美元捡漏 AMD MI50:老平台加卡跑 30B 模型提速近 9 倍
tabletuser_blogspot · reddit · 2026-09-20
Reddit 用户在 GTX-1080Ti(11GB 显存)基础上加装一张仅 140 美元的二手 AMD Radeon MI50(16GB,刷成 Radeon VII 固件),组成 27GB 显存的本地推理平台,用 llama.cpp Vulkan 版实测多款 30B 级模型。
- 系统用 Kubuntu + Vulkan 预编译版,无驱动冲突;通过 GGMLVKVISIBLEDEVICES 分别测单卡与双卡,附完整 llama-bench 命令
- 实测模型包括 Qwen3.5 35B MoE(MXFP4)、Nemotron 31B MoE、Qwen3.5 27B、Gemma3 27B、Gemma4 26B MoE 等多个 GGUF 量化版本
- 稠密模型受益最大:Gemma3 27B 生成速度从 1.5 t/s 升到 14.96 t/s(约 +896%),Qwen3.5 27B 从 2.1 t/s 到 15.6 t/s(+642%),Nemotron 31B +504%
- MoE 模型本身单卡已够快,双卡主要提升生成与预填充吞吐
- 结论:140 美元就能让本地跑 30B 级稠密模型成为现实选择
「Infra」频道最新
- 单张 RTX 5090 跑 Qwen3.8 Flash Next:靠 expert caching 达 50 t/s — dir3ctly · 2026-09-20
- 数据中心真的没交税?Tax Foundation 数据给出各地税率对比 — AndyMasley · 2026-09-20
- AMD 为 Kimi-K3 做重磅软件优化,国产模型硬件适配提速 — AccBalanced · 2026-09-20
- 内存价格半年从350涨到640美元,个人换机越来越难 — chrisalbon · 2026-09-20
- NVIDIA 工程师详解 DeepSeek V4.1 Flash 为速度重构架构 — thursdai_pod · 2026-09-20
- halogen 0.12.0 让 Strix Halo 跑百万上下文解码提速至 38 tok/s — peonist-ai · 2026-09-20