285HX上本地跑模型:CPU竟然最快
nirurin · reddit · 2026-07-12
一位用户在 Intel 285HX 的 mini PC 上测试本地运行 LLM 的效果,对比了 Llama.cpp 的不同后端与多个模型,重点看 CPU、Vulkan、SYCL+iGPU 的速度差异。
测试环境
- 机器:MS-02,Intel Core Ultra 285HX,64GB 内存
- 工具:Llama.cpp,尝试 Llama-Swap,但在 SYCL 下不太方便
- 模型:Qwen3、Qwen3.6、Gemma4 的多个量化版本
结果
- Vulkan:整体最慢,部分模型只有 0.5–4 tk/s
- SYCL(iGPU+CPU):明显好于 Vulkan,约 8–12 tk/s
- CPU-only:反而最快,Qwen3-30B 约 16.5 tk/s,Qwen3.6-35B 约 14 tk/s
观察与结论
- 过去资料普遍说 Vulkan > SYCL,但在这代基于 ARC 的 iGPU 上,结果似乎相反,或者至少没有文档里说得那么差。
- 作者还不确定 iGPU 是否带来效率收益,因为还没做功耗测试。
- 目前看,纯 CPU 反而是最快方案。
- 在这些测试里,Gemma4 不太值得,而 Qwen3 / Qwen3.6 的 CPU 方案相当实用,作者倾向于认为 3.6 值得优先尝试。
所属事件:实测285HX本地跑模型CPU反超iGPU(2 条相关)→
「Infra」频道最新
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11