实测 Ollama 0.40 预发布版:MLX 提速是真的,但稳定版换个 tag 就有
TheOyinbooke · x · 2026-09-29
作者在 16GB Mac Mini M4 上对比了 Ollama 0.40.0-rc0(默认启用 MLX)与稳定版 0.34.4 的实际表现:
- 提速是真的:Gemma 4 在 MLX 上快约 2.5 倍,但稳定版通过拉取不同模型 tag 同样能获得,装预发布版并没有让已有模型变快
- 翻车点:预发布版默认把 Qwen 3.8 换成 27.8B nvfp4 MLX 构建,在 16GB 机器上下载 18GB 后拒绝加载(需 16.9 GiB,仅剩 11.3 GiB 可用),报 500 错误
- 测试方法:4 个固定 prompt(短对话、约 2200 token 摘要、Python 记账函数、记忆推理),每个跑 3 次取中位数,temperature 0、8192 token 上下文
作者给 0.40.0-rc0 在 16GB Mac 上打 5/10 分:方向正确,但在这台机器上几乎不改变现状。
「Infra」频道最新
- LayerSkip:单模型自推测解码,免掉独立草稿模型的推理加速框架 — burkov · 2026-09-29
- SpaceX 官宣超级计算机、Terafab、Gigasat 等多项基建布局 — elonmusk · 2026-09-29
- 马斯克称算力将迁往太空,Google 先验证 TPU 能否在太空工作 — CackleRooster · 2026-09-29
- Gimlet 与 Cerebras 规划 100 MW 算力,推理速度可达 3000 tokens/秒 — Sethwinterroth · 2026-09-29
- 单卡 3090 跑 Qwen 27B 达 95+ TPS、262K 上下文,LlamAmpere v0.4 发布 — Brief-Tap-6616 · 2026-09-29
- 美国人更反对在家门口建数据中心,而非核反应堆 — PeterDiamandis · 2026-09-29