MoEspresso 让 32GB M1 Max 本地跑 Qwen3.8-Flash-Next 达 12-15 tok/s

marcobaldo · reddit · 2026-09-28

推理引擎 MoEspresso 的作者发布第三版:在 2021 年的 32GB M1 Max 上,以 12-15 tok/s 的解码速度本地运行 125B 的 Qwen3.8-Flash-Next(需关闭浏览器等占内存应用)。

核心技术点:

作者还给出 48 题可复现基准:Qwen3.8 Flash @ MoEspresso 得 84.3 分,超过 GPT-6 Luna xhigh(81.4)、Claude Opus 4.8 xhigh(80.3)等托管服务,略低于 hosted Qwen3.8 Flash(89.7)和 GPT-6 Sol medium(89.2)。

通过 Homebrew 安装:brew install steadfastgaze/tap/moespresso,代码与模型均在 GitHub/HF 开放,后续计划支持 Linux 和 AMD Strix Halo。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →