专题 · FULL STORY
剪枝让 Qwen3 巨兽跑进笔记本
开发者尝试将 Qwen3.8-Flash-Next(180B 级 MoE)压缩到消费级设备运行:先以 REAP 方法剪掉 25% 专家大幅降低显存占用,随后 Eyal Toledano 结合剪枝与查表技巧,在 48GB 内存的 MacBook 上以 Q4 量化跑通该模型。
2026-08-27 ~ 2026-08-28 · 2 集 · 4 条
第 1 集 · Qwen3 180B 模型剪枝后可在笔记本运行(2026-08-27,2 条)
开发者对 Qwen3.8-Flash-Next(180B 级 MoE)进行专家剪枝实测:采用 REAP 方法剪掉 25% 专家(REAP-384)后,显存/内存占用从约 97GB 降至 65GB 左右;再结合 NVMe offload(PLE)与 mmap 优化,可在单张 48GB 显卡乃至笔记本上运行该级别大模型,大幅降低部署门槛。
- Qwen3 MoE 剪枝实测:180B 级模型压到 65GB 可跑笔记本 — EyalToledano · 2026-08-27
- 72GB 显存跑 180B 模型?offload+剪枝实测 — EyalToledano · 2026-08-27
第 2 集 · 开发者用剪枝加查表把大模型塞进 48GB MacBook(2026-08-27,2 条)
开发者 Eyal Toledano 通过剪枝和查表等技巧,将 Qwen3.8-Flash-Next 跑进 48GB 内存设备:Q4 量化在 MLX 上仅占约 39GB 内存。他随后更正称,28 tok/s 的解码速度实际适用于 M4 Max 等高带宽机型,MacBook Air 因带宽更低解码会慢很多,但模型仍可运行。
- Qwen3.8-Flash-Next 塞进 48GB MacBook:剪枝+查表上盘只用 39GB — EyalToledano · 2026-08-27
- 两个技巧让 Qwen3.8-Flash-Next 塞进 48GB MacBook Air — EyalToledano · 2026-08-28