Ollama 预览版集成 MLX 框架,苹果芯片推理大幅提速
awnihannun · x · 2026-08-16
Ollama 发布基于 Apple MLX 框架的预览版,专为苹果芯片优化。通过利用统一内存架构和 M5 系列芯片的 GPU 神经加速器,新版本在首字延迟和生成速度上实现显著提升。实测显示,使用 Qwen3.5-35B-A3B 模型时,Prefill 速度达 1851 token/s,解码速度达 134 token/s。此外,新版本支持 NVIDIA 的 NVFP4 格式以提升推理质量和效率。
「Infra」频道最新
- 2026系统设计指南:掌握这10个核心概念 — blaizedsouza · 2026-08-17
- AI经济学类比:全AI服务器揭示算力与电力成新瓶颈 — demian_ai · 2026-08-17
- 构建Agent生产级服务层:连接池与熔断实践 — blaizedsouza · 2026-08-17
- 专家担忧嵌入式设备难升级成 AI 安全短板 — johnowhitaker · 2026-08-17
- 求助:将 Qwen3.8 27B 转换为 ONNX 格式以适配 NPU — xXDennisXx3000 · 2026-08-17
- Gonka 推出 1M 上下文 V4-Flash 分布式推理 — autoimago · 2026-08-17