llama.cpp 用户询问能否把 MoE 专家从 RAM 进一步下沉到 SSD
Ok_Warning2146 · reddit · 2026-07-23
llama.cpp 能把 MoE 的非共享专家放到 SSD 吗?
作者在问:llama.cpp 现有的 -cmoe 方案,已经能把 MoE 模型的非共享专家加载到 RAM、同时把其他权重和 KV cache 放在 GPU VRAM 上;那么能不能进一步把这部分专家放到 SSD 上?
他的设想
- 非共享专家不放 RAM,而是放在 SSD。
- 由 CPU 负责运行。
- 其余权重和 KV cache 继续留在 GPU VRAM。
背后的动机
他直言原因很现实:RAM 太贵,而 MoE 模型还在持续变大,所以更激进的分层存储/加载策略会很有价值。
「编程与Agent」频道最新
- 开源视频号下载 Skill 支持直接用 URL 保存视频 — vista8 · 2026-07-23
- Fleet engineering 把 vibe coding 变成并行 AI 编程流程 — victor_explore · 2026-07-23
- 开源仓库打包 21 章智能体设计模式与代码笔记 — tom_doerr · 2026-07-23
- Keel Code 用多模型循环让编码 Agent 直到任务完成 — Scobleizer · 2026-07-23
- 开源工具给 Claude Code agent 加上预算预检 — getnable · 2026-07-23
- Stas Bekman 又发了一份 AI 工具链用的 SKILL.md — StasBekman · 2026-07-23