llama.cpp新PR:缓存MoE热门专家,8GB显存推理速度翻倍
BTA_Labs · reddit · 2026-08-05
llama.cpp 的一项新 PR (#26563) 引入了 MoE 专家热力图追踪功能。它不再将所有专家保留在 GPU 或全部卸载到 CPU,而是将高频使用的“热门专家”缓存在显存中,“冷门专家”则继续在 CPU 上运行。
作者在 8GB 显存下运行 Qwen3.6-35B-A3B 的测试结果显著:
- Q2M 量化:33.25 提升至 56.0 tok/s(1.68倍)
- Q5KP 量化:17.34 提升至 35.93 tok/s(2.07倍)
但该方法并非万能:对于专家复用率不高的模型(如 Qwen3.5-122B-A10B),开启缓存反而会因额外的追踪和管理开销导致速度变慢。目前该功能仅支持 CUDA,且仅在单 token 解码期间生效,输出结果可能会因缓存的专家不同而产生微小差异。这为在消费级显卡上运行大型 MoE 模型且不依赖极端低量化提供了新方向。
「Infra」频道最新
- 美国 NSF 斥资 1 亿美元建设区域性 AI 基础设施中心 — mkratsios47 · 2026-08-05
- Chutes AI 全面启用 TEE 验证,8x RTX 5090 算力性价比超专业卡 — markjeffrey · 2026-08-05
- engyai 上线 OpenRouter 最廉价 Kimi K3 API,成本降半 — const_reborn · 2026-08-05
- LiquidAI 新模型实测:Mac 本地跑 128K 上下文解码达 82 tok/s — helloiamleonie · 2026-08-05
- ai&携手Voltaiq:为日本AI数据中心部署电池储能系统 — DavidBennett__ · 2026-08-05
- 128GB 内存 Mac 跑本地大模型,哪款最适合写代码? — Electronic_Back1502 · 2026-08-05