ik_llama.cpp 分支 MoE 优化:混合执行让低端卡提速 20-30%

IceFog72 · reddit · 2026-10-06

作者发布 kllama.cpp 分支更新,核心是 MoE 专家驻留与 CPU/GPU 混合执行:

适用条件:MoE 模型整体装不下 VRAM 但 GPU 仍有空闲算力与 PCIe 带宽。在 RTX 2060 6GB + DDR4 平台上跑 Qwen3.6-35B-A3B Q4,默认 ikllama.cpp 约 23 t/s,该分支约 26-30 t/s,提速 20-30%。作者还给出完整启动命令与调参建议:GPU 利用率约 75% 时可少放 1-2 个普通层并设 1-2GB 驻留上限。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →