ik_llama.cpp 真的更快吗:多 GPU 实测反被 mainline 大幅超越

vulcan4d · reddit · 2026-10-07

Reddit 用户 vulcan4d 分享了一组反常识的本地推理基准:ikllama.cpp 常被誉为混合 CPU/GPU 卸载与 MoE 性能之王,但在他的 4 卡异构机器上全面落后于 mainline llama.cpp。

测试环境

结果

作者的关键技巧:Pascal 卡严格控制在 9.7GB 显存内(超了会触发 PCIe 微分页)、用 --poll 防 AVX-512 线程掉入低功耗状态。他推测 ikllama 的优势可能仅限纯 CPU 或单卡场景,多卡流水线分层时 mainline 的 CUDA graph 缓存占优,欢迎同类配置用户指正。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →