1080Ti+MI50 双卡 Vulkan 跑分:MoE 模型吞吐可超 600 t/s
tabletuser_blogspot · reddit · 2026-09-15
Reddit 用户在 i9 36 核平台(Nvidia GTX 1080 Ti 11GB + AMD Instinct MI50 16GB)上,用 llama.cpp 的 Vulkan 后端(开启 -fa on)实测了 13 个模型的 pp512 与 tg128 速度。
要点:
- 混用 Nvidia/AMD 双卡可行,Vulkan 后端可作为跨厂商方案
- 小 MoE 模型表现突出:bailingmoe2 16B.A1B 预填充 643.73 t/s、生成 123.29 t/s 全场最快;qwen3moe 30B.A3B 达 295/62 t/s
- 稀疏模型 tg128 明显优于同规模 dense 模型(27B dense 生成仅 15-17 t/s)
- Flash Attention 对该配置性能影响可忽略
- 4.5 bpw 量化的 Phi-3.5-MoE(42B)生成速度仍达 50 t/s
结论:老卡用户靠 Vulkan 混插小 MoE 模型能获得不错的本地推理体验。
「Infra」频道最新
- 为什么让 AI 提炼三条结论还要等十分钟:Prefill 与 Decode 机制解析 — dotey · 2026-09-15
- 单张 H100 四小时从零训练,ARC-AGI-1 拿下 76% — GregKamradt · 2026-09-15
- 从 Ollama 到 vLLM:LLM 部署升级路线图与场景选择指南 — kalyan_kpl · 2026-09-15
- Kimi K3 上线 NVIDIA NIM,可免费调用 OpenAI 兼容接口 — airesearch12 · 2026-09-15
- 双卡本地推理怎么选:R9700 对比 $1600 二手 RTX 3090 — Current-Ticket4214 · 2026-09-15
- RTX 5090 涨至 6899 美元翻倍,内存比显卡还贵装机最难时 — Yuchenj_UW · 2026-09-15