95.5GB 的 Qwen 模型塞进 64GB Mac:专家流式加载跑出 27 tok/s
SnooPredictions515 · reddit · 2026-09-19
作者成功在 64GB M5 Pro Mac 上以主模型方式运行 95.5 GiB 的 Qwen3.8-Flash-Next:核心是专家流式加载——MoE 路由专家留在 SSD,只有 token 实际路由到时才读取(基于 mihailescu2m 的工作,需用其 llama.cpp fork,官方版不支持该 flag)。
关键优化与数据:
- Prefill:26.8GiB 逐层嵌入表在 mmap 下每次 gather 触发页错误,改为直接文件读后 512-token 提速 181→401 tok/s,8k 提速 274→451。
- Decode:启用 draft head 投机解码(小模型猜 3 token、大模型一次验证),18→27.6 tok/s;4k 提示词处理 367 tok/s,29k 上下文实际对话约 20.6 tok/s。
- 调参比想象重要:22 臂扫描显示 depth 3 + 0.3 置信度下限比硬编码 depth 4 快 10%;稀疏注意力 gather 在 62k/130k 上下文分别 +19%/+50%,Metal MoE 融合再 +5-9%。
- 量化方案:bartowski Q40 + Q80 输出层,常驻张量组拼接 unsloth UD-IQ4XS,40-chunk 困惑度 5.2777→4.3148,仅多占 1.69GiB。
- 坑:expert cache 与 Metal wired limit 必须同步,64GB 上缓存 36GiB 是天花板,38GiB 会因堆交换跌至 3.7 tok/s。
模型与 fork 均已开源,README 有完整五步安装命令。
「Infra」频道最新
- M4 每周期可执行 10 条指令,超多数竞品,M5 提速另有玄机 — lemire · 2026-09-19
- Apple M6 核心数增至12,作者解析CPU仍在快速进步 — lemire · 2026-09-19
- Apple M2 到 M5 三年性能提升约 50%, gradual 无跳跃式增长 — lemire · 2026-09-19
- Daniel Lemire 拆解 Apple M2→M5:主频提升 30% 是性能主因 — lemire · 2026-09-19
- OpenAI 揭秘推理路由:比例控制器为何换成全局优化器 — AI Engineer · 2026-09-19
- DGX Spark 双机太贵,本地 AI 硬件 affordability 引热议 — FlolightC · 2026-09-19