实测 M3 Max 跑通 125B Qwen 模型,推理速度达 70tok/s

mayfer · x · 2026-08-28

开发者实测了在 Apple Silicon 上通过 mlx-serve 原生运行 Qwen 3.8 Flash Next (125B-A6B) 模型。在 M3 Max (128GB) 设备上,串行推理速度约为 70 tok/s,预填充约 300 tok/s,可完成 32k token 任务且仍有 20GB 内存余量。

该项目基于 MLX 框架,使用 Zig + Metal 实现,无需 Python。核心优化包括:超连接残差流、从磁盘直接加载 n-gram 嵌入、2k token 后的稀疏注意力(SpM),以及 5 个新增的 Metal 内核。模型支持图像和视频输入,并针对长上下文进行了优化。

所属事件:M3 Max 本地跑通 125B Qwen 模型,推理速度达 70tok/s(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →