36GB MacBook 通过 SSD 流式加载跑起 35B 到 480B 模型
Illustrious-Cup-5895 · reddit · 2026-07-26
作者声称,自己通过 把 MoE 专家权重从 SSD 按需流式加载,让一台 36GB 内存的 MacBook 也能跑起 35B–480B 级别的 coding 模型。
这套方案以原生 macOS 应用的形式发布,内置引擎,可直接作为本地服务接到 Cursor、Cline、OpenCode 等工具上。作者还特意公开了“跑得通”和“跑不通”的基准:
- Qwen3.6-35B-A3B:10 GiB cache 下约 13 tok/s,14 GiB 时约 19 tok/s
- Laguna 118B-A8B:约 2.8 tok/s,适合批处理,不适合聊天
- 最大收益来自把流式专家文件放到更快的盘上,单这一项就带来 2.7× 提升
- 预取预测、双 SSD 条带、HOT expert 预留都没有带来收益,甚至有负效应
帖子强调这是一个 100% 本地运行 的方案,并提供了失败实验的完整记录。
「编程与Agent」频道最新
- 多智能体系统把命名和职责边界变成团队级决策 — edgarpavlovsky · 2026-07-26
- 六个 AI 窗口同时写代码,成了这位开发者的日常 — gandamu_ml · 2026-07-26
- Stack Overflow 警告 AI 编程工具正在制造理解债务 — pchandrasekar · 2026-07-26
- 一个 agent 几小时迁完老旧 WordPress 站,还省下 95% 成本 — MartinGTobias · 2026-07-26
- AI Toolkit 新增 Mage-Flow 与 Mage-Flow Edit 微调支持 — ostrisai · 2026-07-26
- 一个能跨多文件调试的 AI 编程工作区后端 — Feisty-Marzipan-5127 · 2026-07-26