实测 M3 Max 跑通 125B Qwen 模型,推理速度达 70tok/s
mayfer · x · 2026-08-28
开发者实测了在 Apple Silicon 上通过 mlx-serve 原生运行 Qwen 3.8 Flash Next (125B-A6B) 模型。在 M3 Max (128GB) 设备上,串行推理速度约为 70 tok/s,预填充约 300 tok/s,可完成 32k token 任务且仍有 20GB 内存余量。
该项目基于 MLX 框架,使用 Zig + Metal 实现,无需 Python。核心优化包括:超连接残差流、从磁盘直接加载 n-gram 嵌入、2k token 后的稀疏注意力(SpM),以及 5 个新增的 Metal 内核。模型支持图像和视频输入,并针对长上下文进行了优化。
所属事件:M3 Max 本地跑通 125B Qwen 模型,推理速度达 70tok/s(2 条相关)→
「Infra」频道最新
- AI数据中心被指高耗水?实测数据揭示闭环设计真相 — robleclerc · 2026-08-28
- DFlash 2 推出块扩散推测解码,显著加速 GLM-5.3-Flash — songhan_mit · 2026-08-28
- NVIDIA 推出 Mesh 开源计算网络,聚合闲置 GPU 跑 AI — nvidia · 2026-08-28
- AI 自动化研究发现 vLLM/SGLang 底层数值错误 — josh_tobin_ · 2026-08-28
- Hot Chips 观察:推理芯片进入「群雄 ferment 时代」 — BenBajarin · 2026-08-28
- 实测 Muon 优化器:残差梯度平滑且稳定 — stochasticchasm · 2026-08-28