Qwen3 MoE 剪枝实测:180B 级模型压到 65GB 可跑笔记本
EyalToledano · x · 2026-08-27
- 开发者对 Qwen3.8-Flash-Next 做专家剪枝(REAP 方法)实测,初步结果亮眼:
- REAP-384(剪掉 25% 专家):显存/内存占用从 97GB 降到 80GB,相对原版保持约 89% 准确率;
- REAP-256(剪掉 50% 专家):占用降到 65GB,准确率约 81%,且加载速度翻倍。
- 有趣的副作用:REAP-256 变得更话痨,思考(thinking)比原版更多。
- 结论:一台 128GB 内存的笔记本现在能以 65GB 加载一个 180B 级模型,还留 40GB+ 余量给长上下文——「有望成为日常主力机」。
「Infra」频道最新
- 史上首家初创公司实现铀浓缩,拟建核动力数据中心 — Polymarket · 2026-08-27
- G2 年花 127 万美元购千亿 Token,追求极致效率 — prasanna_says · 2026-08-27
- 智谱 GLM 3.5 Flash 六天免费处理 42 万亿 token,全靠国产芯片 — bindureddy · 2026-08-27
- TokenVisor 支持在单集群中混合使用 Nvidia/AMD/Intel GPU — AccBalanced · 2026-08-27
- Zai 国内推理集群破 10 万,智谱自研高速互联 — zephyr_z9 · 2026-08-27
- PeriodicLabs 用 Kimi 降低推理成本 50 倍 — LiamFedus · 2026-08-27