Celeron N5095 实测:Ollama CPU 推理快 llama.cpp 16-35%,Vulkan 降温 27℃

tre7744 · reddit · 2026-09-02

作者在低功耗 Celeron N5095 小主板上对 Ollama 0.32.1 与 llama.cpp(commit 9a286ac)做了严格对齐的对比测试(相同 prompt、Q4KM 文件、4096 上下文、4 线程、96 生成 token)。

主要发现

结论:日常 CPU 使用选 Ollama;Vulkan 只建议跑 Qwen3 0.6B/1.7B;MTP 关掉。完整数据、脚本与失败时间线已开源。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →