两个技巧让 Qwen3.8-Flash-Next 塞进 48GB MacBook Air

EyalToledano · x · 2026-08-28

作者更正:此前说 48GB MacBook Air 的情况适用于 M4 Max 等高带宽机型(28 tok/s);MacBook Air 带宽更低,解码会慢很多,但模型仍可在显存预算内运行。

核心做法是在 MLX 上跑 q4 量化(仅占 39GB 内存),q8 也只需 50GB,关键叠加了两个技巧:

所属事件:开发者用剪枝加查表把大模型塞进 48GB MacBook(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →