苹果硅质实现 ANE+GPU 联合加速,预填充提速 50%

bakawolf123 · reddit · 2026-08-20

有开发者成功破解了在 Apple Silicon 上同时调用 ANE(神经网络引擎)和 GPU 进行预填充(prefill)的难题。该方法通过对 MLP 和 GDN 进行分片优化,在 M3 Ultra 上运行 Qwen3.8 27B q4 模型时实现了约 50% 的预填充速度提升。实测在 M1 Pro 32GB 上运行 9B 模型也能获得约 19% 的提速(280 -> 334 tokens/s)。该功能已合并至 omlx 仓库,需从源码编译并开启自定义内核选项才能使用。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →