M5 Ultra 能跑哪些开源模型?实测追踪器给出答案
dreamingwell · reddit · 2026-08-26
开发者基于 mlx-lm 和 vllm-mx 构建了一个实时追踪器,可按 Mac 型号、内存和数量联动查看哪些开源权重模型真正能本地运行。256GB M5 Ultra Mac Studio 的核心结论:
- GLM-4.7 是当前能跑的最强模型:4-bit 量化 198.6 GB,装进 256GB 后还剩约 21 GB 给 KV cache,mlx-lm 无未解决问题
- DeepSeek V4 Flash(284B/13B 激活,151 GB)理论最合适但无可用运行时:vllm-mlx 拒绝该架构,mlx-lm 缺少 deepseekv4.py
- GLM-5.2 三重受阻:IndexShare 索引器加载失败、超过 2048 token 后经共享 DSA 模块的解码崩溃、395 GB 体积在加载时触发 GPU watchdog
- Qwen3.8-27B 能跑但混合架构的前缀缓存被静默关闭,相同 24k prompt 零复用,已有修复 PR 实测差距约 58 倍
- Meta Muse Glimmer 30B 是黑马:Apache-2.0 协议、全量 MLX 量化、无未解决问题,且在 MCP Atlas 榜单领先
VRAM 数据取自 HF 仓库 safetensors 实际求和而非估算,每个阻塞项都附 GitHub issue 链接;M5 Ultra 尚未实测,吞吐数据为建模值。
「Infra」频道最新
- 数据中心耗水被高估?数据:缺水地区它们反而最划算 — NathanpmYoung · 2026-08-26
- 苹果 M5 Ultra 解码碾压 DGX,英伟达算力护城河遭多面围攻 — XFreeze · 2026-08-26
- MetricFire 发布 MCP 服务器,让 AI 查询监控数据 — PKMNPinBoard · 2026-08-26
- LLM 推理一次只算一个 step:连续批处理如何榨满 GPU — arpit_bhayani · 2026-08-26
- 曝 OpenAI 新芯片能效比超英伟达 Rubin — nickbaumann_ · 2026-08-26
- 开启 30 天推理工程挑战:深入 Blackwell 与 CUDA — blelbach · 2026-08-26