llama.cpp 争论 `--cpu-moe` 是否比默认显存卸载更快
kwizzle · reddit · 2026-07-23
有人在讨论 llama.cpp 里是否该启用 --cpu-moe,对比默认的“尽量把权重塞进 VRAM,再溢出到系统内存”的策略。
- 帖子先说明当前默认行为:优先占满显存,剩余部分再落到 RAM。
- 作者听说把所有 MoE 权重放到 CPU 可能避免时序问题,但自己有限测试后发现,不启用 --cpu-moe 反而略快。
- 这条讨论的核心其实是 MoE 权重卸载策略与推理性能取舍,属于本地推理优化经验。
「Infra」频道最新
- Neon 说,agent 已做出可用的 Git 托管服务 — cramforce · 2026-07-24
- NVIDIA 称托管 RL 让 Nemotron 3 Nano 以不到 5 美元升到 91% — NVIDIAAI · 2026-07-24
- 一个 AI 流水线先识别 10 多家来源的列,再入仓处理 — YvesMulkers · 2026-07-24
- Qwen 在 Ubuntu Docker 下输出异常,WSL 2 环境却正常 — awitod · 2026-07-23
- Gavin Baker:开源 AI 的利润会从模型层转向算力层 — mattbeane · 2026-07-23
- 开发者称 Cloudflare 快到能直接部署到预览域名 — joshgonsalves_ · 2026-07-23