llama.cpp新PR:缓存MoE热门专家,8GB显存推理速度翻倍

BTA_Labs · reddit · 2026-08-05

llama.cpp 的一项新 PR (#26563) 引入了 MoE 专家热力图追踪功能。它不再将所有专家保留在 GPU 或全部卸载到 CPU,而是将高频使用的“热门专家”缓存在显存中,“冷门专家”则继续在 CPU 上运行。

作者在 8GB 显存下运行 Qwen3.6-35B-A3B 的测试结果显著:

但该方法并非万能:对于专家复用率不高的模型(如 Qwen3.5-122B-A10B),开启缓存反而会因额外的追踪和管理开销导致速度变慢。目前该功能仅支持 CUDA,且仅在单 token 解码期间生效,输出结果可能会因缓存的专家不同而产生微小差异。这为在消费级显卡上运行大型 MoE 模型且不依赖极端低量化提供了新方向。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →