llama.cpp 支持 M5 神经加速器,Mac 上 MLX 已无必要?
MrPecunius · reddit · 2026-09-03
楼主发现在 Apple M5 上,llama.cpp 的 Metal 后端疑似已支持 M5 的 matmul/神经加速器,GGUF 模型(如 Unsloth Q8)的 prefill 速度达到约 300-350 t/s,与 MLX 最好的成绩持平;加上 GGUF+MTP 在生成速度上一直是首选(约 19 t/s),作者认为已没有理由继续用 MLX 模型。
此前 MLX 的优势仅在 prefill,用户需要按生成/prefill 比例切换模型格式,颇为麻烦。作者以 Qwen3 27B Q8 为例征求社区意见:是否还有继续用 MLX 的理由,或该配置下能否跑出更好成绩。
「Infra」频道最新
- Perplexity 开源 Lily:Apple 芯片 Qwen 专用推理引擎,解码快 35% — inductionheads · 2026-09-03
- Mitchell Hashimoto 公开 Superlogical 服务器内存优化实录 — sull · 2026-09-03
- Lily 跑分:M5 Max 上预填吞吐高 MLX-LM 23%,解码高 35% — perplexity_ai · 2026-09-03
- Perplexity 开源本地推理引擎 Lily,专为 Apple 芯片上的 Qwen3.6 打造 — perplexity_ai · 2026-09-03
- FastH3 实现本地推理:支持 Apple Silicon 与 DGX Spark — Vandy_simp · 2026-09-03
- 断言:没有数据中心建设潮,美国早已陷入严重衰退 — ZeeshanZiaML · 2026-09-03