M3 Max 本地跑通 125B Qwen 模型,推理速度达 70tok/s
开发者实测在 Apple Silicon 上通过 mlx-serve 原生运行 Qwen 3.8 Flash Next(125B-A6B)模型。在 M3 Max(128GB)上推理速度达 70 tok/s,预填速度约 300 tok/s,执行 32k 任务后仍余 20GB 内存。用户指出机器过热时会有降频问题,但整体表现可观。
2026-08-28 ~ 2026-08-28 · 2 条相关
- 实测 M3 Max 跑通 125B Qwen 模型,推理速度达 70tok/s — mayfer · 2026-08-28
- M3 Max 本地跑出 70 tok/s,32k 任务后仍余 20GB 内存 — mayfer · 2026-08-28