Vulkan 比 CUDA 低温 20 度还快:llama.cpp 后端选择实测心得

Hot-Employ-3399 · reddit · 2026-08-28

笔记本用户实测:在 27B Qwen 模型上,llama.cpp 的 Vulkan 后端比 CUDA 低约 20°C(长生成时 65-75°C vs 85-95°C),还多 2-3 token/s;代价是模型加载极慢,且部分层卸载到内存时(如 35B Moe)速度崩到 10 tok/s 以下。限 GPU 频率、降线程数都没改善。他在找更好的设置或替代推理后端(vLLM、exllama 等)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →