llama.cpp 提交 PR:新增 CPU 卸载密集模型 FFN 层选项
pmttyji · reddit · 2026-08-19
llama.cpp 社区提交了 PR,提议为密集模型添加 --n-cpu-ffn 选项,类似现有 MoE 模型的 --n-cpu-moe。该优化允许将 FFN 层卸载至 CPU,从而在显存受限(如 16GB)的设备上运行更大的密集模型(如 Qwen 3.8 27B)。指南展示了在 Q4KM 量化下运行 27B 模型并保持 130k 上下文和约 20t/s 速度的实测效果。
「Infra」频道最新
- Marvell 获 Google 认股证,合作开发 TPU 生态定制芯片 — firstadopter · 2026-08-19
- Marvell 与 Google 签定制芯片协议,接入 TPU 生态用于 AI 推理 — firstadopter · 2026-08-19
- SALT:基于 CELF 的 KV Cache 句子级压缩检索 — No_Sky9786 · 2026-08-19
- 超越人类直觉:AI 设计出 500 倍于工程师极限的微小芯片组件 — ChuckDBrooks · 2026-08-19
- ComfyUI 突发卡顿崩溃,MiniMax H3 节点报错求助 — Fit-Association-448 · 2026-08-19
- 建议 Anthropic 用 Tenstorrent 降低推理成本 — DavidBennett__ · 2026-08-19