llama.cpp 支持 M5 神经加速器,Mac 上 MLX 已无必要?

MrPecunius · reddit · 2026-09-03

楼主发现在 Apple M5 上,llama.cpp 的 Metal 后端疑似已支持 M5 的 matmul/神经加速器,GGUF 模型(如 Unsloth Q8)的 prefill 速度达到约 300-350 t/s,与 MLX 最好的成绩持平;加上 GGUF+MTP 在生成速度上一直是首选(约 19 t/s),作者认为已没有理由继续用 MLX 模型。

此前 MLX 的优势仅在 prefill,用户需要按生成/prefill 比例切换模型格式,颇为麻烦。作者以 Qwen3 27B Q8 为例征求社区意见:是否还有继续用 MLX 的理由,或该配置下能否跑出更好成绩。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →