Qwen3.8-Flash-Next 塞进 48GB MacBook:剪枝+查表上盘只用 39GB

EyalToledano · x · 2026-08-27

开发者 Eyal Toledano 把 Qwen3.8-Flash-Next 跑进了 48GB 的 MacBook Air:Q4 量化在 MLX 上仅占 39GB 内存、28 tok/s 解码,Q8 也只需 50GB。原版 Q4 需要 97GB。

他叠了两个技巧:

结果:288 专家 + 表在 NVMe 上,加载 6 秒、常驻 39GB、解码 28 tok/s、预填充 600 tok/s,logits 与纯内存版完全一致。代价是 HumanEval 从 93.9% 降到 91.5%(288 专家 vs 原版)。

下一步他已构建好 MTP drafter 和 n-gram lookup drafter 两个投机解码方案,正在跑分。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →