RX 7900 GRE 混搭十年前的 RX 480,双卡推理提速 36%
tabletuser_blogspot · reddit · 2026-09-08
Reddit 用户在 llama.cpp Vulkan 构建(b10453)下测试 AMD 双卡推理:RX 7900 GRE 16GB 单卡跑不动 20B 以上模型,加入一块老 RX 480 8GB(带宽仅 256 GB/s,单卡生成速度只有 1.8 t/s)后显著提升。
实测结果
- Gemma4 26B-A4B Q4KM:单卡 7900 GRE 生成 37.93 t/s,双卡 52.03 t/s,提升约 36%;预填充从 238 提到 321.6 t/s。
- 传统 27B 稠密模型(Qwen35 27B Q6K)仅 5.96 t/s,Q5KM 也只 11.73 t/s。
- Gemma4 26B-A4B 这种 MoE 模型开关 Flash Attention 几乎无差别(52.03 vs 51.94 t/s)。
结论:即使是带宽差得多的老卡组双 GPU,对 MoE 模型的本地推理收益依然可观。
「Infra」频道最新
- 黄仁勋确认 GPT-6 Astra 用超 10 万块 Grace Blackwell 训练 — rohanpaul_ai · 2026-09-08
- 韩国拟推「AI for All」:全民免费生成式 AI,配 512 块 B200 — IgorCarron · 2026-09-08
- 32GB 显存跑 Qwen3.8-27B 写代码,社区征集本地模型选型经验 — theexile1337 · 2026-09-08
- 开发者自制 Windows 托盘 NVIDIA 显存监控小工具 — Due-Committee-9591 · 2026-09-08
- LTX2.5 在 Mac 上纯本地生视频,对比 MiniMax H3 的 36GB 门槛 — cocktailpeanut · 2026-09-08
- 用 RL 训 Kimi 基座模型设计变压器,一次推理压缩数周工程 — ycombinator · 2026-09-08