Qwen3 180B 模型剪枝后可在笔记本运行

开发者对 Qwen3.8-Flash-Next(180B 级 MoE)进行专家剪枝实测:采用 REAP 方法剪掉 25% 专家(REAP-384)后,显存/内存占用从约 97GB 降至 65GB 左右;再结合 NVMe offload(PLE)与 mmap 优化,可在单张 48GB 显卡乃至笔记本上运行该级别大模型,大幅降低部署门槛。

2026-08-27 ~ 2026-08-27 · 2 条相关

事件全程(共 2 集)→