Ollama为Mac自动开启Qwen3.5推测解码,MLX后线速大幅提升
BTA_Labs · reddit · 2026-08-05
Ollama 最新发布的 v0.32.6-rc0 版本为 Apple Silicon 用户带来了显著的推理优化:当 Qwen3.5 模型包含内置的 MTP(Multi-Token Prediction)张量时,Ollama 的 MLX 后端会自动加载该模块,将模型自身作为推测解码的草稿模型,无需额外配置。
自适应推测深度控制
MTP 模块每步提议一个 token,而 Ollama 的控制器会根据实测成本和接受率动态调整推测深度。新版本还增加了详细的请求日志统计,包括草稿/接受 token 数、接受率、平均及最大推测深度等。
性能争议与后端差异
尽管 Ollama 官方仅表示“Qwen3.5 在 Apple GPU 上更快”,但社区发现此前 llama.cpp 在 Metal 后端测试 MTP 时反而出现了 11% 到 27% 的降速(例如在 M1 Max 上从 25.3 tok/s 降至 19.3 tok/s)。作者指出,Ollama 此前曾报告其 MLX MTP 实现让 Gemma 4 提速近 90%,这表明后端实现和自适应深度控制器可能比单纯的 MTP 支持更关键。目前仍需标准化的基准测试来对比 MLX 与 Metal 后端的真实差异。
「Infra」频道最新
- a16z 播客:三家初创公司重塑美国硬科技基础设施 — a16z Podcast · 2026-08-05
- 小红书多模态推理优化:视觉Token压缩与MoE重路由 — 小红书技术REDtech · 2026-08-05
- Python 无 GIL 版本性能实测:CPython 与 NumPy 优化详解 — abhi9u · 2026-08-05
- 探讨Groq超高速推理:实际表现与质量是否达标? — Scared-Tip7914 · 2026-08-05
- xAI 超算中心落户孟菲斯,当地房屋库存反暴增 65% — brianrkelly · 2026-08-05
- 戴尔之子扎克·戴尔储能公司BasePower融资10亿美元,估值130亿 — 创业邦 · 2026-08-05