llama.cpp 在 Intel iGPU 上实测很一般
nirurin · reddit · 2026-07-13
一位用户实测了 llama.cpp 在 Intel iGPU(Arrow Lake)上的表现,结论是 iGPU 方案并不理想。
实测结果
- Vulkan:基本不可用,或极慢,最高大约只有 1 tok/s。
- SYCL:表现最好,Qwen3.6 35B 大约能跑到 12 tok/s;prefill 可到 20 tok/s,但不稳定,有时会卡死。
- CPU:最稳定,推理约 14 tok/s,prefill 约 30–40 tok/s。
部署环境
他在 Unraid 上测试了多种组合:
- llama.cpp 的 CPU / Vulkan / SYCL Docker 容器
- LM-Studio 运行在 Webtop 容器里
- llama-swap 的 CPU / Vulkan 容器
结论
他怀疑要么是 Intel iGPU 对这类推理任务确实没太大用,要么是自己的配置有问题,因此向社区求助是否有人把它真正跑顺、并且获得实际收益。
所属事件:实测285HX本地跑模型CPU反超iGPU(2 条相关)→
「Infra」频道最新
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11