M3 Max 36GB 本地推理实测:Qwen3.6 MoE 达 110 tok/s
Hyungsun · reddit · 2026-10-05
作者花约 2498 美元购入 14 核 M3 Max MacBook Pro(36GB),在 macOS 27 上对比四款本地推理引擎(oMLX 0.7.0、Rapid-MLX 0.15.5、Splash 1.2.1、MTPLX 2.12.2),统一 temperature 0、关闭思考模式,每组测 3 次取中位数。
核心结果(decode,自然散文提示词):
- Qwen3.6-35B-A3B(MoE):Rapid-MLX 最快 110.2 tok/s,oMLX 104.2 接近,Splash/MTPLX 约 77-79
- Qwen3.8-27B(dense):Splash 31.7 tok/s 与 MTPLX 31.5 并列,oMLX 仅 17.9——这正贴着 300GB/s 带宽 + 16GB 权重的理论上限,其他引擎靠投机解码突破
- Splash 在 MoE 上波动极大:填充文本 1.5K 提示下高达 238 tok/s,5.5K 降到 101;Rapid 稳定在 118
其他发现:
- 5.5K 提示的首 token 延迟:MoE 约 4-5 秒,dense 约 34 秒(prefill 1.2k vs 150 tok/s)
- 持续推理时风扇全开,不适合图书馆场景
- 125B 的 Qwen3.8-Flash-Next 4bit 权重就要 74-83GB,36GB 机器跑不动
- 注意各引擎 KV cache 跨重启保留,重复跑分会虚高
结论:按你主用的模型选引擎即可,差距不大时选功能顺手的。作者因日常用 MoE 留下了 Rapid-MLX。
「Infra」频道最新
- YuE2 纯浏览器跑通:MacBook 上 60 秒生成 40 秒歌曲 — realmrfakename · 2026-10-06
- 推算 DeepSeek 一个月跑 13 亿个沙箱:峰值 17 万并发,约 3-5 分钟一个 — teortaxesTex · 2026-10-06
- Perplexity CEO:有用户每月为 agent 消耗超 1 万美元算力 — rohanpaul_ai · 2026-10-06
- Burry 转推 NVIDIA 拆解系列:详解 Blackwell 营收与 beat-and-raise 逻辑 — BLUECOW009 · 2026-10-06
- 微软重启三里岛核电站,为 AI 数据中心供电 — DavidLinthicum · 2026-10-06
- 曝 Oracle 向管理层推自愿离职方案,12 月或再迎大规模裁员 — saibharadwaj · 2026-10-06