Vulkan 比 CUDA 低温 20 度还快:llama.cpp 后端选择实测心得
Hot-Employ-3399 · reddit · 2026-08-28
笔记本用户实测:在 27B Qwen 模型上,llama.cpp 的 Vulkan 后端比 CUDA 低约 20°C(长生成时 65-75°C vs 85-95°C),还多 2-3 token/s;代价是模型加载极慢,且部分层卸载到内存时(如 35B Moe)速度崩到 10 tok/s 以下。限 GPU 频率、降线程数都没改善。他在找更好的设置或替代推理后端(vLLM、exllama 等)。
「Infra」频道最新
- 三张 R9700 32GB 才抵一张 5090:本地玩家纠结换 AMD 阵营 — MrHall · 2026-08-28
- 腾讯混元开源Hy4-preview:770B参数、1M上下文,开源榜约第3 — 机器之心 · 2026-08-28
- DeepSeek V4 Flash 定价疑云:如何做到与 GPT OSS 20B 持平? — gajesh · 2026-08-28
- Qwen3.8-Flash 训练成本仅需 Qwen3.7-Plus 九分之一 — VraserX · 2026-08-28
- 主权 AI 市场达 1.5 万亿,企业正逃离美云 — mikeflache · 2026-08-28
- ComfyUI 双卡部署实践:文本与 VAE 一卡、扩散模型一卡 — hurdurdur7 · 2026-08-28