M5 Ultra 80 核跑 GLM-5.3-Flash:大内存爽,GPU 成瓶颈
dreamingwell · reddit · 2026-09-25
作者在 256GB、80 核的 M5 Ultra Mac Studio 上测试多个模型的 agentic 推理,分享多轮实测结果。GLM-5.3-Flash 在本地跑出了令人满意的速度(自称 DwarfStar 级)。
主要结论:
- 大内存对跑大模型价值明显,性能令人满意
- 但 GPU 算力相对内存明显偏弱,成为瓶颈
- 作者据此质疑:512GB 版本对 AI 推理是否有意义——内存再大,GPU 瓶颈依旧
对考虑购买大内存 Mac 做本地推理的人是有用的第一手参考。
「Infra」频道最新
- 用 vLLM 内核做 SQL 式 AI 过滤:定制调度器与工作负载感知 KV 缓存 — charles_irl · 2026-09-25
- 扩散架构推理提速:Augment Code 换用 Mercury 2.5,延迟降 82% 成本降 90% — cen6wkf · 2026-09-25
- Oracle 回应数据中心不可抗力通知:交付预期未变,租金照付 — AIFlow_ML · 2026-09-25
- SemiAnalysis 看好中国半导体设备国产化进程 — zephyr_z9 · 2026-09-25
- Meta Muse 模型仅用 AMD EPYC 服务器 CPU 两个核心运行 — firstadopter · 2026-09-25
- 传 AMD 四季度 AI GPU 与消费卡全线涨价约 10% — Beth_Kindig · 2026-09-25