64GB Mac 跑通约百 GB 量级 Qwen 模型,13 万上下文可用

chibop1 · reddit · 2026-10-11

Reddit 用户报告在 M3 Max 64GB 上用 oMLX 最新提交成功运行 Qwen 大模型量化版本(Qwen3.8-Flash-Next-oQ4e-mtp),此前两周还跑不起来,现在可将约 58GB 内存分配给 GPU,支持最高 130k 上下文。

实测短会话数据:

关键 oMLX 设置:memory guard 设为 Aggressive、热缓存上限 2GB、开启 Lightning MTP、MoE Expert Offload 且常驻专家设为 50%。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →