llama.cpp 新增选项:支持密集模型 FFN 层 CPU 卸载

jacek2023 · reddit · 2026-08-27

llama.cpp 项目提交了一个 Pull Request,新增 --n-cpu-ffn 选项。该选项类似于现有的 --n-cpu-moe,允许用户指定将密集模型的 FFN(前馈网络)子层数量卸载到 CPU 上执行。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →