Mac端侧推理优化:20B MoE模型仅占500MB内存实现40 TPS
netikas · reddit · 2026-08-10
作者分享了在 MacBook Air M4 上实现极致本地大模型推理优化的探索过程,核心目标是大幅降低内存占用。
- 模型选型困境:传统小参数模型(如 Qwen3 0.6B/1.7B)虽内存占用小,但通用能力太弱;而通过量化压缩的大模型(如 Bonsai-27B)在 Mac 上运行又过于缓慢。
- Maple-Preview 方案:近期发布的 20B 参数 MoE 模型 Maple-Preview 专为 Mac 端侧推理设计,从头以三值精度训练。模型本体仅 5.31 GB,带 131K 上下文约 7.5 GB。
- 极致内存优化:作者将 Maple-Preview 接入 Mference(turbo-fieldfare 的分支),通过将权重保留在 SSD 并从磁盘流式加载 MoE 专家,最终在 Air M4 上仅占用 500MB RAM 即实现 40 TPS 的生成速度。
- 能力评测:该模型世界知识有限且基本只懂英语,但在接入 Web 搜索后能处理简单问题。作者实测其工具调用能力(Tau-2 基准)表现一般,期待后续针对 Agent 负载的优化。
「Infra」频道最新
- 单卡 H200 提升 41% 吞吐:LLM 离线蒸馏新法大幅降低显存 — MultiverseComputingCAI · 2026-08-10
- 迁移成本增50%:南华早报解析中国AI巨头难舍英伟达 — pstAsiatech · 2026-08-10
- RTX 5090 推理飙升至 233 tok/s,推测解码效果远胜 Mac — rohanpaul_ai · 2026-08-10
- 降低推理成本新思路:探讨端云协同的模型分割架构 — komorra · 2026-08-10
- 英伟达拟豪掷30亿美元投资Lancium,锁定数据中心电力 — 智东西 · 2026-08-10
- antirez 开源 MiniMax H3 Mac 推理引擎:基于 Metal 加速 — antirez · 2026-08-10