64GB Mac mini 用 SSD 流式加载 MoE 专家,解码仍有 27% 时间在等盘

turtleninja99 · reddit · 2026-10-05

作者在 64GB Mac mini(M5)上跑 Qwen Flash Next q4 模型,显存放不下全部专家权重,采用「热专家留缓存 + 其余从 SSD 流式加载」的方案:

项目开源在 Flash-next-ssd,作者征集进一步提升 GPU 利用率的思路。

所属事件:玩家在 64GB Mac mini M5 上本地跑 Qwen Flash Next(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →