开源项目 mlx-dspark 让 Mac 跑大模型提速 3.3 倍
A-Rahim · reddit · 2026-08-13
开发者 A-Rahim 发布了开源项目 mlx-dspark,通过在 Apple Silicon 上使用投机解码技术,大幅提升了 Meta 的 Muse Glimmer 30B 模型的运行速度。
在 M4 Pro 芯片的实测中,8-bit 模型的生成速度从 8.2 tok/s 提升至 18-26 tok/s。其中数学场景提速最明显(3.27x),代码场景 2.5x,对话场景 2.22x。由于目标模型会验证每个 token,该方案的输出与普通解码完全一致,实现了零质量损失的加速。
此外,4-bit 量化下速度约为 25 tok/s(提速 1.7x),仅需 18GB 内存;而 8-bit 峰值需 40GB 内存。这相当于让用户以 4-bit 的速度体验 8-bit 的质量。
「Infra」频道最新
- 单卡B300跑1.6T模型:新量化框架实现50 tok/s — dosco · 2026-08-13
- Menlo Park 电价高达 53.8 美分:自建 GPU 算力已不划算 — generativist · 2026-08-13
- 8GB显存跑图:RTX 3070 Ti本地实测Krea 2 Turbo — niechta · 2026-08-13
- Fluidstack 走访纽交所,探讨美国 AI 算力基建投资 — MxMnr · 2026-08-13
- 开源CUDA替代方案:实现AMD GPU代码跨平台移植 — tom_doerr · 2026-08-13
- AMD 7900 XT 跑 Gemma 模型掉速:131K 上下文成性能瓶颈 — opoot_ · 2026-08-13