Mac Studio M5 Ultra 本地运行 320B 模型仅需两万美分之一成本
SumitGup · x · 2026-08-29
实测数据显示,Apple Silicon 的统一内存架构非常适合本地运行大模型。配备 512GB 内存的 Mac Studio M5 Ultra 可完整装载 FP8 格式的 GLM-5.3-Flash (320B) 模型,离线推理速度约 60 tokens/s。而在 PC 端达到同等显存配置需 10 张 RTX 5090,成本超过 2 万美元,且功耗巨大。
「Infra」频道最新
- 实测 STM32 与 ESP32 运行通用机器人控制策略 — yacineMTB · 2026-08-29
- 隐私架构构建信任:用户愿向 AI 敞开心扉 — bgmshana · 2026-08-29
- NVIDIA 开源 srt-slurm:YAML 编排 Slurm 集群上的推理服务 — AccBalanced · 2026-08-29
- 双 3090 跑 Qwen3.8-Flash-Next:专家下放内存,51B n-gram 表落 NVMe — jbro1985 · 2026-08-29
- 社区发布 Qwen3.8 Flash 量化版:省 20-30GB 内存磁盘,质量持平 unsloth — Dutchnamn · 2026-08-29
- 加州金融欺诈系统如何构建物理隔断的 AI 堡垒 — AI Engineer · 2026-08-29