ik_llama.cpp 真的更快吗:多 GPU 实测反被 mainline 大幅超越
vulcan4d · reddit · 2026-10-07
Reddit 用户 vulcan4d 分享了一组反常识的本地推理基准:ikllama.cpp 常被誉为混合 CPU/GPU 卸载与 MoE 性能之王,但在他的 4 卡异构机器上全面落后于 mainline llama.cpp。
测试环境
- CPU:i9-10920X(12 核,开 AVX-512/VNNI)
- GPU:3× P102-100(10GB Pascal)+ 1× RTX 3060 12GB 作主卡
- 模型:Qwen 3.8 Flash-Next 177B(IQ3XXS,约 89GB,带视觉),35 层上 GPU、13 层留 CPU,32k 上下文
结果
- Mainline:prompt eval 19.70 tok/s,生成 10.86 tok/s,复用 2490 个 CUDA graphs
- ikllama.cpp:prompt eval 5.48 tok/s(降 72%),生成 8.43 tok/s(降 22%),完全没启用 CUDA graphs,且生成中频繁做上下文 checkpoint(100ms+ 停顿),还不支持 --poll
作者的关键技巧:Pascal 卡严格控制在 9.7GB 显存内(超了会触发 PCIe 微分页)、用 --poll 防 AVX-512 线程掉入低功耗状态。他推测 ikllama 的优势可能仅限纯 CPU 或单卡场景,多卡流水线分层时 mainline 的 CUDA graph 缓存占优,欢迎同类配置用户指正。
「Infra」频道最新
- Marvell 投资日披露 100mm 硅片,遭质疑尺寸过小 — jwt0625 · 2026-10-07
- 泡沫期创业拿云厂积分的暗坑:克隆、账单陷阱与烂服务 — mkheck · 2026-10-07
- NVFP4 让 2.4 万亿参数模型只用 1/4 GPU,单 token 成本最高降 73% — ryanshrout · 2026-10-07
- Intel 高管:agentic AI 大量时间耗在等待,关键指标是端到端时长 — ryanshrout · 2026-10-07
- 三台异构机器跑本地推理,如何统一服务与监控? — ziyaulhuk12 · 2026-10-07
- Beff Jezos:解耦推理是未来,异构算力云正当其时 — beffjezos · 2026-10-07