Gemma 4 在 48GB Mac 上本地实测,MLX 对比 llama.cpp 和 Java 25
rseroter · x · 2026-07-28
这条帖在比较 Gemma 4 26B-A4B 如何在一台配备 48GB 统一内存的 Apple Silicon MacBook Pro 上本地运行。
- 场景是通过 Java 25 + LangChain4j 做全本地调用。
- 对比了 MLX、带 MTP speculative decoding 的 llama.cpp,以及纯 Java 25 路径。
- 重点不是模型发布本身,而是本地推理部署与性能的实测。
被引用的原帖还提到,Gemma 系列累计下载量已超过 9 亿次。
「Infra」频道最新
- B200 微调实测最高提速 5.8 倍、显存减半 — antoine_chaffin · 2026-07-28
- Packed-encoders 通过去掉 padding 计算把训练提速 5 倍 — antoine_chaffin · 2026-07-28
- Bittensor 子网扩容被视为企业 AI 基建新路径 — markjeffrey · 2026-07-28
- Project Orion 在三大洲异构算力上直播训练 16B 模型 — markjeffrey · 2026-07-28
- Modular 推理手册拆解 LLM 成本瓶颈与部署优化 — udmrzn · 2026-07-28
- Kimi K3 通过 Merge Gateway 接入美国推理与 ZDR 通道 — shensi · 2026-07-28