开发者将180B级Qwen3.8剪枝量化塞进48GB Mac

开发者 Eyal Toledano 完成了一项把 180B 级 MoE 模型塞进消费级 Mac 的实验:基于 Qwen3.8-Flash-Next,通过结构化剪枝与 MLX 量化,4 位版本仅需 39GB 内存即可运行,且 HumanEval 保持在 91.5%。该实验说明大模型的专家冗余可通过真实使用数据分析安全压缩,为本地运行超大模型提供了可行路径。

已确认

为什么重要

2026-08-27 ~ 2026-08-28 · 5 条相关

一手来源