MI50 16GB 跑 Qwen MoE:expert-pool 分支提速至 17 t/s
Atretador · reddit · 2026-09-18
作者在 llama.cpp 的 moe-expert-pool 分支(memoriaru fork)基础上,让 Qwen 系 MoE 模型在单张 MI50(16GB 显存,gfx906)上跑通 expert cache 并实测提速:
- 问题:原版 admission budget 预留全部上下文 KV 且有 3 GiB 硬上限,16GB 卡跑 128K Q8 时 144 个 offload expert 张量一个都装不下,功能静默失效
- 测试平台:Xeon E5-2673 V4、4x16GB 内存、MI50 16GB(120W 功耗限制)、Arch Linux
- 结果:stock CPU MoE 路径 11.76 t/s(10.17 GiB);expert cache 80 实际 40 槽位达 16.39 t/s(命中率 61.8%);cache 66 时冷/热 16.90/17.60 t/s,热机后峰值观测到 19.8 t/s
完整运行脚本(含全部参数)见 pastebin,仓库地址 atretador/gfx906-16gb-expert-pool。对用老旧 AMD 显卡本地跑 MoE 的人是直接可复用的方案。
「Infra」频道最新
- NanoGPT 竞速新纪录 68 秒:QK 维度砍到 96 叠加 FP8 注意力 — kellerjordan0 · 2026-09-18
- 对冲基金经理:Anthropic 每 token 成本远低于 OpenAI — rohanpaul_ai · 2026-09-18
- 工程师爆料:企业根本数不清自己有多少台服务器,有人干脆藏机器 — irth7 · 2026-09-18
- SK 海力士旗下 Solidigm 拟在美国建 NAND 闪存厂 — zephyr_z9 · 2026-09-18
- 华为轮值董事长:2027 年国内 AI 训练将大规模转向昇腾 950DT — pstAsiatech · 2026-09-18
- Jev playground 显示推理与往返延迟,欧洲访问多付 120ms — DanielLockyer · 2026-09-18