两个技巧让 Qwen3.8-Flash-Next 塞进 48GB MacBook Air
EyalToledano · x · 2026-08-28
作者更正:此前说 48GB MacBook Air 的情况适用于 M4 Max 等高带宽机型(28 tok/s);MacBook Air 带宽更低,解码会慢很多,但模型仍可在显存预算内运行。
核心做法是在 MLX 上跑 q4 量化(仅占 39GB 内存),q8 也只需 50GB,关键叠加了两个技巧:
- REAP 剪枝:把专家池从 68GB 压到 35GB;
- 51B n-gram 表改存 SSD 而非内存:patch 对分片做 mmap,每次查找直接从磁盘读约 100 字节再反量化。
所属事件:开发者用剪枝加查表把大模型塞进 48GB MacBook(2 条相关)→
「Infra」频道最新
- NVIDIA 拟收购 Hugging Face,开源 AI 重心或易主 — dscape · 2026-08-28
- NVIDIA Vera 芯片规模出货,为 AI Agent 优化 CPU 瓶颈 — rohanpaul_ai · 2026-08-28
- llama.cpp 分支合并 Qwen3.8-Flash 支持,5090 上 Q4 量化跑出 44 tks — giveen · 2026-08-28
- 英伟达季度财报惊艳,华尔街单日暴涨 9% — mitchdeg · 2026-08-28
- antirez 移植 GLM 5.2 Flash 模型,M5 Max 可流畅运行 — antirez · 2026-08-28
- Reddit 构想:10 个 7B 编码模型组成分布式集群能否打过单个 70B — According-Extent6016 · 2026-08-28