llama.cpp 新增选项:支持密集模型 FFN 层 CPU 卸载
jacek2023 · reddit · 2026-08-27
llama.cpp 项目提交了一个 Pull Request,新增 --n-cpu-ffn 选项。该选项类似于现有的 --n-cpu-moe,允许用户指定将密集模型的 FFN(前馈网络)子层数量卸载到 CPU 上执行。
「Infra」频道最新
- Cursor 用户单月消耗 4720 亿 Token,算力成本成主要限制 — Daniel_Farinax · 2026-08-27
- 96GB Mac Studio 能否跑 Qwen3.8?SSD 卸载实测分析 — Mxmtm · 2026-08-27
- 亚马逊 S3 架构解密:280 万亿对象背后的 Rust 重写与热管理 — Franc0Fernand0 · 2026-08-27
- Prefix Sliding:丢弃冗余推理 token,测试时扩展提速 3 倍 — Bedrovelsen · 2026-08-27
- 个人车库算力巢实拍:5 节点 Mellanox 网络与家庭改造 — Substantial_Cut_9418 · 2026-08-27
- llama.cpp 合并 PR:新增 Nanbeige4.2-3B(dspark)支持 — jacek2023 · 2026-08-27