自写 C+Metal 运行时让 M3 Pro 跑 Qwen3.8-27B 达 18 tok/s
buryhuang · reddit · 2026-08-19
作者在 36GB 内存的 Mac M3 Pro 上本地运行 Qwen3.8-27B,实现 18 tok/s,称已达到可日常使用的水平。他对比了 llama.cpp、mlx-lm、oMLX 后,最终回归自写的 C + Metal 运行时:把模型编译成针对该机器的镜像,Q4 权重约 15GB,mmap 进统一内存,并套一层 OpenAI 兼容 API 供应用调用。
本周末的重点是投机解码:重放、验证 kernel 和草稿词表。实测代表任务:
- 完整 LRUCache 实现(1155 输出 token)平均 17.7 tok/s,六次运行输出完全一致,token 间延迟约 55ms;
- 散文类任务接受率较低,约 10-11 tok/s;五个任务平均 11.95 tok/s,不开投机解码为 7.96 tok/s,约 1.5 倍加速;
- TTFT:短 prompt 约 1.4s,128 token prompt 约 2.7s。
他指出 M3 Pro 内存带宽仅约 120GB/s,27B Q4 跑到 18 tok/s 已接近带宽墙;同机对比下自写运行时目前明显快于 llama.cpp。还剩一个 layer-fusion kernel 未实现。项目已开源(MIT),作者计划以此作为日常本地模型,等 MoE 版本再做下一轮折腾。
「编程与Agent」频道最新
- 腾讯发布 UI-Mate-27B,支持桌面 GUI 智能体操作 — tencent · 2026-08-24
- 实测对比:从 DeepSeek 到 Claude 二十美元订阅 — Unlikely_Bluejay5392 · 2026-08-24
- Claude Code 推出远程控制功能,编码效率提升 — rohanpaul_ai · 2026-08-24
- Vercel CEO rauchg 详解 fx 扩展哲学:MCP、Skills、插件与 Unix 组合 — AccBalanced · 2026-08-24
- Netflix 揭秘 LLM Judge 生产实践:每周评估数十万条推荐解释 — omarsar0 · 2026-08-24
- Simon Willison 用 Fable 5 实测 smolvm:硬件级隔离沙箱获认可 — yawnxyz · 2026-08-24