开发者将180B级Qwen3.8剪枝量化塞进48GB Mac
开发者 Eyal Toledano 完成了一项把 180B 级 MoE 模型塞进消费级 Mac 的实验:基于 Qwen3.8-Flash-Next,通过结构化剪枝与 MLX 量化,4 位版本仅需 39GB 内存即可运行,且 HumanEval 保持在 91.5%。该实验说明大模型的专家冗余可通过真实使用数据分析安全压缩,为本地运行超大模型提供了可行路径。
已确认
- 剪枝方法:分析真实代码会话中的专家活跃度,将每层 512 个专家缩减至 288 个(m4)。
- Qwen3.8-Flash-Next-REAP-288-MLX-4bit:MLX 原生 4 位量化,仅需 39GB 内存,体积比原版 q4 更小,HumanEval 保持 91.5%(m1、m3、m4)。
- Qwen3.8-Flash-Next-REAP-288-MLX-8bit:8 位量化,HumanEval 90.9%,常驻内存 70GB,据称比常规 8 位量化的显存占用降低 27%(m2)。
- 性能:Q4 在高带宽机型(如 M4 Max)上解码约 28 tok/s;Q8 需约 50GB 内存(m3、m5)。
- 作者更正:最初称跑在 48GB MacBook Air 上,后说明 28 tok/s 的速度适用于 M4 Max 等高带宽机型;MacBook Air 带宽更低、解码会慢很多,但模型仍可在显存预算内运行(m5)。
为什么重要
- 这套「专家活跃度分析 + 结构化剪枝 + MLX 量化」的流程,展示了在消费级硬件上运行 180B 级模型的现实可能性,且基准损失很小。
- 8 位与 4 位两个版本给显存预算不同的用户提供了选择:39GB 与 70GB 两档常驻内存。
2026-08-27 ~ 2026-08-28 · 5 条相关
一手来源
- 剪枝 512 至 288 专家,让 180B 模型跑上 Mac — EyalToledano ·
- 两个技巧让 Qwen3.8-Flash-Next 塞进 48GB MacBook Air — EyalToledano ·
- Qwen3.8-Flash-Next 塞进 48GB MacBook:剪枝+查表上盘只用 39GB — EyalToledano · 2026-08-27
- 【源头】两个技巧让 Qwen3.8-Flash-Next 塞进 48GB MacBook Air — EyalToledano · 2026-08-28
- Qwen3.8 180B 级模型仅需 39GB 显存即可运行 — EyalToledano · 2026-08-28
- 【源头】剪枝 512 至 288 专家,让 180B 模型跑上 Mac — EyalToledano · 2026-08-28
- Qwen3.8 变体实测:8 位量化显存占用降 27% — EyalToledano · 2026-08-28