苹果硅质实现 ANE+GPU 联合加速,预填充提速 50%
bakawolf123 · reddit · 2026-08-20
有开发者成功破解了在 Apple Silicon 上同时调用 ANE(神经网络引擎)和 GPU 进行预填充(prefill)的难题。该方法通过对 MLP 和 GDN 进行分片优化,在 M3 Ultra 上运行 Qwen3.8 27B q4 模型时实现了约 50% 的预填充速度提升。实测在 M1 Pro 32GB 上运行 9B 模型也能获得约 19% 的提速(280 -> 334 tokens/s)。该功能已合并至 omlx 仓库,需从源码编译并开启自定义内核选项才能使用。
「Infra」频道最新
- 数据中心日耗水 6.27 亿加仑,远低于养牛业与电厂 — rohanpaul_ai · 2026-08-20
- 英伟达发布 CUDA-Q Algorithms,构建容错量子计算原语库 — tomaszbednarz · 2026-08-20
- Dolphin Network 推出 GPU 闲置算力 P2P 推理网络 — toptickcrypto · 2026-08-20
- Epoch 估算:OpenAI 约 1.2%~2.4% 算力用于安全监控 — sjgadler · 2026-08-20
- 观点:Cerebras 极速推理或让 OpenAI 的研发闭环快 20 倍 — Scobleizer · 2026-08-20
- AI 智能体不是微服务,架构需引入持久执行层 — rseroter · 2026-08-20