MacBook 跑 Meta 新模型:Ollama MLX 引擎速度最快达 29 tok/s
ollama · x · 2026-08-11
开发者在 MacBook (M3 Max, 96GB) 上本地运行 Meta 新发布的 Muse Glimmer 30B 模型,并对比了目前可用的几种服务端方案。
测试结果显示,目前最快的方式是使用 Ollama 的 MLX 引擎(包含 DFlash),速度约为 29 tokens/秒;经过调优的 llama.cpp 速度约为 21 tokens/秒;而原始的 mlx-vlm 目前尚未优化,速度约为 10 tokens/秒。
「Infra」频道最新
- 开发者自建微虚拟机沙箱编码智能体,支持本地推理与 iOS 操控 — tom_doerr · 2026-08-11
- SanDisk CEO 称 80% 以上毛利率是对存储产品的合理回报 — Beth_Kindig · 2026-08-11
- 黄仁勋称英伟达正推动 AI 算力成为可投资资产类别 — Polymarket · 2026-08-11
- tinygrad eGPU 驱动获苹果批准,Mac 终于能外接 AMD/NVIDIA 显卡 — ns123abc · 2026-08-11
- 科技巨头算力预算超美国政府,赛博朋克已成现实 — tszzl · 2026-08-11
- 蔡司造出极致平滑镜片:EUV 光刻机精度的硬核科普 — DynamicWebPaige · 2026-08-11