开源项目 mlx-dspark 让 Mac 跑大模型提速 3.3 倍

A-Rahim · reddit · 2026-08-13

开发者 A-Rahim 发布了开源项目 mlx-dspark,通过在 Apple Silicon 上使用投机解码技术,大幅提升了 Meta 的 Muse Glimmer 30B 模型的运行速度。

在 M4 Pro 芯片的实测中,8-bit 模型的生成速度从 8.2 tok/s 提升至 18-26 tok/s。其中数学场景提速最明显(3.27x),代码场景 2.5x,对话场景 2.22x。由于目标模型会验证每个 token,该方案的输出与普通解码完全一致,实现了零质量损失的加速。

此外,4-bit 量化下速度约为 25 tok/s(提速 1.7x),仅需 18GB 内存;而 8-bit 峰值需 40GB 内存。这相当于让用户以 4-bit 的速度体验 8-bit 的质量。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →