MacBook 跑 Meta 新模型:Ollama MLX 引擎速度最快达 29 tok/s

ollama · x · 2026-08-11

开发者在 MacBook (M3 Max, 96GB) 上本地运行 Meta 新发布的 Muse Glimmer 30B 模型,并对比了目前可用的几种服务端方案。

测试结果显示,目前最快的方式是使用 Ollama 的 MLX 引擎(包含 DFlash),速度约为 29 tokens/秒;经过调优的 llama.cpp 速度约为 21 tokens/秒;而原始的 mlx-vlm 目前尚未优化,速度约为 10 tokens/秒。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →