硬刚 Mac:strata-mlx 让 125B MoE 模型跑进 16GB 内存,实测 6-7 tok/s
yibie · reddit · 2026-10-10
Strata 项目能在 12GB 显卡上运行 125B 参数的 MoE 模型 Qwen3.8-Flash-Next,但官方明确不支持 macOS。作者花一天半写了非官方的 strata-mlx,复刻 Strata 设计、直接读取其 GGUF 文件而不改动权重,在 128GB M4 Max 上开发完成。
核心玩法是专家按需驻留:内存装得下多少专家就驻留多少,其余按 token 需要从 SSD 读取。作者把自己的 Mac 限幅模拟小内存机器做了实测:
- 16GB 内存可跑下 66GB 的 Q20 文件,速度 6-7 tokens/s;
- 24GB 机器 19-23 tokens/s,32GB 机器 28-47 tokens/s;
- 该模式下读取 1,537-token prompt 达 273-287 tokens/s;
- 48GB Mac 估计可完整装下 Q20 文件、完全不碰磁盘。
结论:小内存 Mac 能跑远超 RAM 的模型,但速度没有保证。代码、实验日志与开放问题均已开源,欢迎社区在不同内存的 Mac 上测试。
- 项目地址:github.com/yibie/strata-mlx
「Infra」频道最新
- 开发者实践:常驻 VM 上「dev in prod」跑周报小软件 — davidcrawshaw · 2026-10-11
- Zeeg 断言:给 Agent 用持久 VM 已经过时,临时沙箱才是当下正解 — zeeg · 2026-10-11
- OpenRouter 年化推理流水约 15 亿美元,Anthropic 占 36% — deedydas · 2026-10-11
- 传 AMD 上调 GDDR6 供货价,5090 停售涨价压力蔓延 — chemist_slime · 2026-10-11
- M5 Ultra Mac Studio 64 核 vs 80 核:多花 1200 美元等 10 周值吗 — Porespellar · 2026-10-11
- 弗州动物收容所控诉:邻近数据中心噪音吓坏救援犬 — Polymarket · 2026-10-11