剪枝 512 至 288 专家,让 180B 模型跑上 Mac
EyalToledano · x · 2026-08-28
作者基于 Qwen3.8-Flash-Next (180B MoE) 进行了结构化剪枝实验。通过分析真实代码会话中的专家活跃度,将每层 512 个专家缩减至 288 个,并结合 MLX 4-bit 量化,最终在保持 91.5% HumanEval 准确率的同时,将显存需求降至 39GB(含流式加载 n-gram 表),使得在 Apple Silicon 上运行超大模型成为可能。
所属事件:开发者用剪枝+量化把 180B 级 Qwen 模型塞进 MacBook(8 条相关)→
「Infra」频道最新
- 澳洲能源部长:数据中心无化石燃料豁免权 — nordicinst · 2026-08-28
- ZED 相机卖 500 美元?网友自制方案成本仅 150 美元 — _William_F_ · 2026-08-28
- KOTOR 重制版路径追踪渲染器集成了 DLSS 4.5 — Michael_Moroz_ · 2026-08-28
- NVIDIA 发布 NVHBM:单卡显存容量可提升 3 到 5 倍 — Charuru · 2026-08-28
- 教树莓派用神经网络自动读燃气表,完全自动化抄表 — JeremyCMorgan · 2026-08-28
- Ninfer 引擎实测:5090 跑 Qwen3 27B 速度翻倍 — Rollingsound514 · 2026-08-28