MI50 16GB 跑 Qwen MoE:expert-pool 分支提速至 17 t/s

Atretador · reddit · 2026-09-18

作者在 llama.cpp 的 moe-expert-pool 分支(memoriaru fork)基础上,让 Qwen 系 MoE 模型在单张 MI50(16GB 显存,gfx906)上跑通 expert cache 并实测提速:

完整运行脚本(含全部参数)见 pastebin,仓库地址 atretador/gfx906-16gb-expert-pool。对用老旧 AMD 显卡本地跑 MoE 的人是直接可复用的方案。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →