Ollama为Mac自动开启Qwen3.5推测解码,MLX后线速大幅提升

BTA_Labs · reddit · 2026-08-05

Ollama 最新发布的 v0.32.6-rc0 版本为 Apple Silicon 用户带来了显著的推理优化:当 Qwen3.5 模型包含内置的 MTP(Multi-Token Prediction)张量时,Ollama 的 MLX 后端会自动加载该模块,将模型自身作为推测解码的草稿模型,无需额外配置。

自适应推测深度控制

MTP 模块每步提议一个 token,而 Ollama 的控制器会根据实测成本和接受率动态调整推测深度。新版本还增加了详细的请求日志统计,包括草稿/接受 token 数、接受率、平均及最大推测深度等。

性能争议与后端差异

尽管 Ollama 官方仅表示“Qwen3.5 在 Apple GPU 上更快”,但社区发现此前 llama.cpp 在 Metal 后端测试 MTP 时反而出现了 11% 到 27% 的降速(例如在 M1 Max 上从 25.3 tok/s 降至 19.3 tok/s)。作者指出,Ollama 此前曾报告其 MLX MTP 实现让 Gemma 4 提速近 90%,这表明后端实现和自适应深度控制器可能比单纯的 MTP 支持更关键。目前仍需标准化的基准测试来对比 MLX 与 Metal 后端的真实差异。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →