只把「热专家」塞进显存,llama.cpp MoE 吞吐提升 50%
nbvehrfr · reddit · 2026-08-29
一位开发者在 llama.cpp fork 中实现了一个技巧:当 MoE 模型无法完整装入 VRAM 时(以 Qwen 3.8 Flash Next 为例),不做整层 offload,而是只把「热」专家放进显存,吞吐从 20 t/s 提升到 30 t/s(+50%)。
核心观察:在编码、重构、代码审查等同类工作负载下,某些专家分组会保持相对稳定,因此可以针对性缓存。PR 链接:github.com/timadinorth/llama.cpp/pull/1。
注意事项:该 fork 只在编码负载上测过,且仅在模型装不进显存时有收益。作者认为上游大概率不会合并——底层实现是 Opus(Claude)写的,他不想逐行去解释。
「Infra」频道最新
- 数据中心民调反转: Voters 先支持禁建,谈钱后倒戈 — Polymarket · 2026-08-29
- AI数据中心缺电困局:燃料电池成“时间换电力”解法 — tengyanAI · 2026-08-29
- 观察:为何突然涌现大量 DGX Station 个人持有者? — andrew_n_carr · 2026-08-29
- 深入解析 LLM 的四种缓存层:KV/Prefix/Prompt/Semantic — blaizedsouza · 2026-08-29
- Tenstorrent Quietbox 2 到货:256G 内存、128G 互联 GDDR — SashaUsesReddit · 2026-08-29
- DeepSeek 退款劝退用户?V4 贵于 GLM-5.3 引争议 — teortaxesTex · 2026-08-29