llama.cpp 提交 PR:新增 CPU 卸载密集模型 FFN 层选项

pmttyji · reddit · 2026-08-19

llama.cpp 社区提交了 PR,提议为密集模型添加 --n-cpu-ffn 选项,类似现有 MoE 模型的 --n-cpu-moe。该优化允许将 FFN 层卸载至 CPU,从而在显存受限(如 16GB)的设备上运行更大的密集模型(如 Qwen 3.8 27B)。指南展示了在 Q4KM 量化下运行 27B 模型并保持 130k 上下文和约 20t/s 速度的实测效果。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →