Qwen3.8-Flash-Next 塞进 48GB MacBook:剪枝+查表上盘只用 39GB
EyalToledano · x · 2026-08-27
开发者 Eyal Toledano 把 Qwen3.8-Flash-Next 跑进了 48GB 的 MacBook Air:Q4 量化在 MLX 上仅占 39GB 内存、28 tok/s 解码,Q8 也只需 50GB。原版 Q4 需要 97GB。
他叠了两个技巧:
- REAP 剪枝把专家池从 68GB 砍到 35GB(保留 288 个专家);
- 把 51B 的 n-gram 表从内存挪到 SSD,补丁用 mmap 映射分片,每次查找直接从磁盘读约 100 字节,在 CPU 上反量化并经 GPU 路径位级验证。
结果:288 专家 + 表在 NVMe 上,加载 6 秒、常驻 39GB、解码 28 tok/s、预填充 600 tok/s,logits 与纯内存版完全一致。代价是 HumanEval 从 93.9% 降到 91.5%(288 专家 vs 原版)。
下一步他已构建好 MTP drafter 和 n-gram lookup drafter 两个投机解码方案,正在跑分。
「Infra」频道最新
- NVIDIA 首台 Vera Rubin 服务器已交付 AWS,主打 agentic AI 算力 — timzaman · 2026-08-27
- 开源模型已足以上手,端侧部署仍是硬骨头 — dscape · 2026-08-27
- 中国模型迭代速度是美国两倍,8周推理成本降80% — bindureddy · 2026-08-27
- Llama.cpp 配 ROCm 在 780M 上狂崩,一个环境变量救回来 — MaximusSenior · 2026-08-27
- Kioxia 与 Sandisk 宣布在日本投资超 310 亿美元扩产 — badumtsssst · 2026-08-27
- yacine 把立体深度生成延迟压到肉眼难辨,瓶颈多在蠢错误 — yacineMTB · 2026-08-27