llama.cpp 用户询问能否把 MoE 专家从 RAM 进一步下沉到 SSD

Ok_Warning2146 · reddit · 2026-07-23

llama.cpp 能把 MoE 的非共享专家放到 SSD 吗?

作者在问:llama.cpp 现有的 -cmoe 方案,已经能把 MoE 模型的非共享专家加载到 RAM、同时把其他权重和 KV cache 放在 GPU VRAM 上;那么能不能进一步把这部分专家放到 SSD 上?

他的设想

背后的动机

他直言原因很现实:RAM 太贵,而 MoE 模型还在持续变大,所以更激进的分层存储/加载策略会很有价值。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →