开发者用剪枝加查表把大模型塞进 48GB MacBook

开发者 Eyal Toledano 通过剪枝和查表等技巧,将 Qwen3.8-Flash-Next 跑进 48GB 内存设备:Q4 量化在 MLX 上仅占约 39GB 内存。他随后更正称,28 tok/s 的解码速度实际适用于 M4 Max 等高带宽机型,MacBook Air 因带宽更低解码会慢很多,但模型仍可运行。

2026-08-27 ~ 2026-08-28 · 2 条相关

事件全程(共 2 集)→