ik_llama.cpp 分支 MoE 优化:混合执行让低端卡提速 20-30%
IceFog72 · reddit · 2026-10-06
作者发布 kllama.cpp 分支更新,核心是 MoE 专家驻留与 CPU/GPU 混合执行:
- 带宽自适应的 CPU/GPU 执行,集成共享专家驻留思路(基于 arXiv 论文)、jadidbourbaki 的 n-gram 缓存优化
- 新增 Q20 量化支持,可跑 Qwen3.8-Flash-Next-GSQ 等模型
- 可配置专家驻留 VRAM 上限:--moe-resident auto --moe-resident-mib N
适用条件:MoE 模型整体装不下 VRAM 但 GPU 仍有空闲算力与 PCIe 带宽。在 RTX 2060 6GB + DDR4 平台上跑 Qwen3.6-35B-A3B Q4,默认 ikllama.cpp 约 23 t/s,该分支约 26-30 t/s,提速 20-30%。作者还给出完整启动命令与调参建议:GPU 利用率约 75% 时可少放 1-2 个普通层并设 1-2GB 驻留上限。
「Infra」频道最新
- Reddit 求实测:128GB M5 Max Mac Studio 能扛住多智能体本地推理吗 — Simple_Telephone_867 · 2026-10-06
- 网友算账:大模型订阅价被补贴,MiniMax 推理毛利高达七八成 — menhguin · 2026-10-06
- 前沿实验室约 90% 算力已投向后训练与推理 — IanAndrewsDC · 2026-10-06
- KLIF 开源:一个窗口统一管理 llama.cpp、vLLM 等本地推理服务器 — Koksny · 2026-10-06
- 双 RX 7900 XT 跑 Qwen 27B 实测:单流最高 66.5 TPS,离网传 100+ 差多远 — EqualCryptographer67 · 2026-10-06
- 开发者晒 3 万亿 token 用量:9 月烧掉 842B,API 牌价 40.9 万美元订阅仅付 3.4% — doodlestein · 2026-10-06