Celeron N5095 实测:Ollama CPU 推理快 llama.cpp 16-35%,Vulkan 降温 27℃
tre7744 · reddit · 2026-09-02
作者在低功耗 Celeron N5095 小主板上对 Ollama 0.32.1 与 llama.cpp(commit 9a286ac)做了严格对齐的对比测试(相同 prompt、Q4KM 文件、4096 上下文、4 线程、96 生成 token)。
主要发现
- CPU 推理 Ollama 全面更快,内部生成吞吐高 16.1%34.9%(如 Qwen3 4B:2.002 vs 1.484 tok/s)。
- Intel iGPU 走 Vulkan 后,prompt 处理提速 3.313.50 倍,生成快约 16%,封装温度峰值从 81℃ 降到 57℃。
- 大模型 Vulkan 全崩:Qwen3 4B 触发 i915 reset,Phi-4 Mini/Qwen3 8B GPU 挂起,Gemma 3 报 DeviceLostError。
- 零 GPU 层不等于纯 CPU:llama.cpp 仍会把 host 算子搬到 iGPU,需拆分测试才能看清。
- MTP 在 Qwen3.5 0.8B/2B、Gemma 4 E2B 上所有 depth 均比关闭更慢。
结论:日常 CPU 使用选 Ollama;Vulkan 只建议跑 Qwen3 0.6B/1.7B;MTP 关掉。完整数据、脚本与失败时间线已开源。
「Infra」频道最新
- SkyPilot 推出 Agent Sessions:断线后编码 Agent 继续跑在自家 K8s 上 — skypilot_org · 2026-09-03
- 游戏显卡跑赢 hipBLASLt:博客详解 GPU 矩阵乘法优化 — Moist_Weird_42067 · 2026-09-03
- Modal 实习生复盘:环境级预算设计与 agent RL 后训练实践 — dejavucoder · 2026-09-03
- 边缘 AI 杀不死云端 Capex:五大论据反驳云杀手论 — yangastas_paradise · 2026-09-03
- 用自托管 Immich 替代 Google Photos,博主详解省钱方案 — speckx · 2026-09-03
- Microduck 积压非深圳产能问题,而是注塑模具尚未完工 — _akhaliq · 2026-09-03