只把「热专家」塞进显存,llama.cpp MoE 吞吐提升 50%

nbvehrfr · reddit · 2026-08-29

一位开发者在 llama.cpp fork 中实现了一个技巧:当 MoE 模型无法完整装入 VRAM 时(以 Qwen 3.8 Flash Next 为例),不做整层 offload,而是只把「热」专家放进显存,吞吐从 20 t/s 提升到 30 t/s(+50%)。

核心观察:在编码、重构、代码审查等同类工作负载下,某些专家分组会保持相对稳定,因此可以针对性缓存。PR 链接:github.com/timadinorth/llama.cpp/pull/1。

注意事项:该 fork 只在编码负载上测过,且仅在模型装不进显存时有收益。作者认为上游大概率不会合并——底层实现是 Opus(Claude)写的,他不想逐行去解释。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →