Apple M5 Ultra 512GB 版可本地跑 97 个开源模型中的 93 个
bigaiguy · x · 2026-09-04
作者认为 Apple M5 Ultra 真正值得关注的不是 keynote 里的「AI 快 4.3 倍」宣传,而是 Mac Studio 512GB 统一内存 + 1.2TB/s 带宽的组合。
关键数据:
- M3 Ultra 带宽上限为 819GB/s,M5 Ultra 提升到 1.2TB/s;token 生成受内存带宽限制,仅带宽提升就带来约 50% 的推理加速。
- 按 canitrun 追踪器的估算(非实测基准):
- DeepSeek R1 671B @ Q4KM:约 12.7 tok/s
- DeepSeek V4 Flash 284B @ Q80:约 20.8 tok/s
- Llama 4 Maverick 400B @ Q80:约 14.9 tok/s
- GPT-OSS 120B @ BF16 全精度:约 28 tok/s
- Kimi K2.6 1T @ Q2K:约 22 tok/s(能装下,但 Q2 量化质量损失明显)
- 97 个开源权重模型中 93 个能以 8K 上下文完整装进内存;装不下的 4 个是 1.6T-2.4T 级的 DeepSeek V4 Pro、Kimi K3、Qwen3.8 2.4T。
结论:512GB 统一内存让 Mac Studio 成为目前少数能本地运行几乎所有主流开源大模型的消费级设备。
「Infra」频道最新
- 微软命名 Project Zenith:开发者专用 Windows,配 AMD Ryzen AI Halo 芯片 — tomwarren · 2026-09-04
- 开发者重写内核:Reframe 渲染引擎比 Octane/Arnold 快约 48 倍 — D3VAUX · 2026-09-04
- RTX 6000 Pro 本地跑 Qwen3 8B Flash:预填 2000tps 但解码仅 40tps — AppealSame4367 · 2026-09-04
- Voz 深度优化 ANE,iPhone/Mac 本地语音转写提速 5-20 倍 — pcuenq · 2026-09-04
- Gemini 3.8 Flash 单价不变,推理多几步照样让单任务账单变贵 — JuggernautCritical92 · 2026-09-04
- DIT.ai 推出 AI Token 交易所,主流模型报价低至官方价四折 — SucceededMind · 2026-09-04