64GB Mac 跑通约百 GB 量级 Qwen 模型,13 万上下文可用
chibop1 · reddit · 2026-10-11
Reddit 用户报告在 M3 Max 64GB 上用 oMLX 最新提交成功运行 Qwen 大模型量化版本(Qwen3.8-Flash-Next-oQ4e-mtp),此前两周还跑不起来,现在可将约 58GB 内存分配给 GPU,支持最高 130k 上下文。
实测短会话数据:
- 13 次请求,总 prefill 约 32.1 万 tokens,缓存命中率 90.9%
- 预处理(去除缓存)140 tok/s,生成 15.8 tok/s
关键 oMLX 设置:memory guard 设为 Aggressive、热缓存上限 2GB、开启 Lightning MTP、MoE Expert Offload 且常驻专家设为 50%。
「Infra」频道最新
- 192GB 显存跑 426GB MXFP4 版 DeepSeek,多 agent 代码审查实测 — HankYeomans · 2026-10-11
- awesome-local-ai:按任务分类的本地 AI 工具清单,专为 agent 设计 — blaizedsouza · 2026-10-11
- 用一份 prompt 让 AI 修掉占 84% 后端 CPU 的卡死队列 bug — zealcaiden · 2026-10-11
- 899 美元 M4 Mac mini 16GB 跑 ComfyUI:完整实测数据出炉 — FaatmanSlim · 2026-10-11
- Asana 靠稳定会话历史把 Codex agent 成本砍 4 倍,缓存命中率 89% — daniel_mac8 · 2026-10-11
- 「理解 AI 经济最重要图表」:模型层商品化,算力层需求暴增 — dnlkwk · 2026-10-11