Ollama 预览版集成 MLX 框架,苹果芯片推理大幅提速

awnihannun · x · 2026-08-16

Ollama 发布基于 Apple MLX 框架的预览版,专为苹果芯片优化。通过利用统一内存架构和 M5 系列芯片的 GPU 神经加速器,新版本在首字延迟和生成速度上实现显著提升。实测显示,使用 Qwen3.5-35B-A3B 模型时,Prefill 速度达 1851 token/s,解码速度达 134 token/s。此外,新版本支持 NVIDIA 的 NVFP4 格式以提升推理质量和效率。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →