自写 C+Metal 运行时让 M3 Pro 跑 Qwen3.8-27B 达 18 tok/s

buryhuang · reddit · 2026-08-19

作者在 36GB 内存的 Mac M3 Pro 上本地运行 Qwen3.8-27B,实现 18 tok/s,称已达到可日常使用的水平。他对比了 llama.cpp、mlx-lm、oMLX 后,最终回归自写的 C + Metal 运行时:把模型编译成针对该机器的镜像,Q4 权重约 15GB,mmap 进统一内存,并套一层 OpenAI 兼容 API 供应用调用。

本周末的重点是投机解码:重放、验证 kernel 和草稿词表。实测代表任务:

他指出 M3 Pro 内存带宽仅约 120GB/s,27B Q4 跑到 18 tok/s 已接近带宽墙;同机对比下自写运行时目前明显快于 llama.cpp。还剩一个 layer-fusion kernel 未实现。项目已开源(MIT),作者计划以此作为日常本地模型,等 MoE 版本再做下一轮折腾。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →