专题 · FULL STORY

剪枝让 Qwen3 巨兽跑进笔记本

开发者尝试将 Qwen3.8-Flash-Next(180B 级 MoE)压缩到消费级设备运行:先以 REAP 方法剪掉 25% 专家大幅降低显存占用,随后 Eyal Toledano 结合剪枝与查表技巧,在 48GB 内存的 MacBook 上以 Q4 量化跑通该模型。

2026-08-27 ~ 2026-08-28 · 2 集 · 4 条

第 1 集 · Qwen3 180B 模型剪枝后可在笔记本运行(2026-08-27,2 条)

开发者对 Qwen3.8-Flash-Next(180B 级 MoE)进行专家剪枝实测:采用 REAP 方法剪掉 25% 专家(REAP-384)后,显存/内存占用从约 97GB 降至 65GB 左右;再结合 NVMe offload(PLE)与 mmap 优化,可在单张 48GB 显卡乃至笔记本上运行该级别大模型,大幅降低部署门槛。

第 2 集 · 开发者用剪枝加查表把大模型塞进 48GB MacBook(2026-08-27,2 条)

开发者 Eyal Toledano 通过剪枝和查表等技巧,将 Qwen3.8-Flash-Next 跑进 48GB 内存设备:Q4 量化在 MLX 上仅占约 39GB 内存。他随后更正称,28 tok/s 的解码速度实际适用于 M4 Max 等高带宽机型,MacBook Air 因带宽更低解码会慢很多,但模型仍可运行。