硬刚 Mac:strata-mlx 让 125B MoE 模型跑进 16GB 内存,实测 6-7 tok/s

yibie · reddit · 2026-10-10

Strata 项目能在 12GB 显卡上运行 125B 参数的 MoE 模型 Qwen3.8-Flash-Next,但官方明确不支持 macOS。作者花一天半写了非官方的 strata-mlx,复刻 Strata 设计、直接读取其 GGUF 文件而不改动权重,在 128GB M4 Max 上开发完成。

核心玩法是专家按需驻留:内存装得下多少专家就驻留多少,其余按 token 需要从 SSD 读取。作者把自己的 Mac 限幅模拟小内存机器做了实测:

结论:小内存 Mac 能跑远超 RAM 的模型,但速度没有保证。代码、实验日志与开放问题均已开源,欢迎社区在不同内存的 Mac 上测试。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →