开源推理引擎让 Gemma 4 26B 在 M 系列 Mac 仅占约 2GB 内存
gitpusher42 · hn · 2026-07-29
开源 Swift 推理引擎可在 M 系列 Mac 上用约 2GB 内存跑 Gemma 4 26B
开发者发布了一个名为 TurboFieldfare 的开源推理引擎,使用 Swift + Metal 实现,目标是在任意 M 系列 Mac 上,以大约 2GB 内存运行 Gemma 4 26B-A4B-IT。
核心做法
- 该模型的 4-bit 量化权重约 14GB,在 8GB 甚至 16GB Mac 上,叠加系统、应用和 KV cache 后通常很难直接跑。
- 运行时把 共享层 和 KV cache 放在内存里。
- 只把每个 token 需要的 路由专家 从 SSD 流式加载。
- 通过小型专家缓存和受限并发 pread,在 SSD 读取期间让 GPU 继续计算共享层。
表现与功能
- 在 8GB 的 M2 MacBook Air 上,速度约 5–6 tok/s。
- 在 M5 MacBook Pro 上,速度约 31–35 tok/s。
- 还提供了一个 兼容 OpenAI 协议 的本地服务端,支持 流式输出、工具调用,以及复用 KV cache 前缀。
- 首次运行会从 Hugging Face 下载约 15GB 权重。
作者表示自己做了 100+ 次实验 才跑通,并欢迎反馈。
「Infra」频道最新
- WULF CEO 揭秘:数据中心闭环系统极省水 — robleclerc · 2026-08-24
- Cursor 团队推 Git 大规模架构,力挺无状态化存储 — thesephist · 2026-08-24
- Cursor 团队 Git 大作获赞:无状态存储将重写基础设施 — thesephist · 2026-08-24
- AI 性能工程资源清单 v2 发布:从单次推理到 MoE serving 全覆盖 — AccBalanced · 2026-08-24
- 韩国半导体工程师地位超越医生,家长意愿成风向标 — SuB8u · 2026-08-24
- 现代编程的“VendorOps”困局 — vboykis · 2026-08-24