剪枝 512 至 288 专家,让 180B 模型跑上 Mac

EyalToledano · x · 2026-08-28

作者基于 Qwen3.8-Flash-Next (180B MoE) 进行了结构化剪枝实验。通过分析真实代码会话中的专家活跃度,将每层 512 个专家缩减至 288 个,并结合 MLX 4-bit 量化,最终在保持 91.5% HumanEval 准确率的同时,将显存需求降至 39GB(含流式加载 n-gram 表),使得在 Apple Silicon 上运行超大模型成为可能。

所属事件:开发者用剪枝+量化把 180B 级 Qwen 模型塞进 MacBook(8 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →