MoEspresso 让 32GB M1 Max 本地跑 Qwen3.8-Flash-Next 达 12-15 tok/s
marcobaldo · reddit · 2026-09-28
推理引擎 MoEspresso 的作者发布第三版:在 2021 年的 32GB M1 Max 上,以 12-15 tok/s 的解码速度本地运行 125B 的 Qwen3.8-Flash-Next(需关闭浏览器等占内存应用)。
核心技术点:
- Cache-Prior 专家缓存偏置:解码时对已驻留内存的专家加偏置,同时始终保留模型选出的两个最强专家;prefill 阶段不偏置。思路受 Apple AFM 3 剪枝工作与 Cache-Prior 论文启发,详细文档见仓库 docs/cacheprior.md。
- 量化与内存:大量 routed projection 使用 IQ2K(标准 MLX 和主线 llama.cpp 都不支持),通过自研 mlx-iqk 库在 Metal 上执行;KVarN K4/V4 让上下文增长时留更多内存给常驻专家。
- 默认策略自动化:专家装不下时自动启用 SSD 流式读取和 Cache-Prior。
作者还给出 48 题可复现基准:Qwen3.8 Flash @ MoEspresso 得 84.3 分,超过 GPT-6 Luna xhigh(81.4)、Claude Opus 4.8 xhigh(80.3)等托管服务,略低于 hosted Qwen3.8 Flash(89.7)和 GPT-6 Sol medium(89.2)。
通过 Homebrew 安装:brew install steadfastgaze/tap/moespresso,代码与模型均在 GitHub/HF 开放,后续计划支持 Linux 和 AMD Strix Halo。
「Infra」频道最新
- 英伟达拟每季向中国供 50 万块 RTX Pro 5500,字节订单要两个季度才能交付 — pstAsiatech · 2026-09-28
- Nvidia 吐槽出口管制过时,称中国芯片厂 2022 年来空前增长 — pstAsiatech · 2026-09-28
- 从 16GB 到 128GB:一路升级本地 AI 硬件的经验 — TheOyinbooke · 2026-09-28
- Liquid AI 主张端侧跑 Agent:350M-2.6B 模型,推理零按 token 计费 — JosephJacks_ · 2026-09-28
- 用药清单坚持本地处理:Bonsai 2 在 Mac Studio 5.75 秒比对两份清单 — MaziyarPanahi · 2026-09-28
- 百元内二手 Tesla P100 跑本地大模型:生成速度反超游戏显卡近一倍 — Mrinohk · 2026-09-28