64GB Mac mini 用 SSD 流式加载 MoE 专家,解码仍有 27% 时间在等盘
turtleninja99 · reddit · 2026-10-05
作者在 64GB Mac mini(M5)上跑 Qwen Flash Next q4 模型,显存放不下全部专家权重,采用「热专家留缓存 + 其余从 SSD 流式加载」的方案:
- 当前性能:解码 17.5 tok/s,prefill 390 tok/s
- 瓶颈:解码期间 27% 的时间 GPU 在等专家权重从 SSD 流入
- 已做优化:prompt 处理的 carousel 缓冲(加载速度基本超过 GPU 消费速度)、MTP、前瞻预取下一层专家(预取命中率 72%)、热缓存命中率 75%
- 想法:扩展前瞻预取、为猜测预取单独设 staging buffer 避免驱逐热专家
项目开源在 Flash-next-ssd,作者征集进一步提升 GPU 利用率的思路。
所属事件:玩家在 64GB Mac mini M5 上本地跑 Qwen Flash Next(2 条相关)→
「Infra」频道最新
- AI 算力系统能耗被指超需百倍,电力瓶颈成基建大风险 — DavidLinthicum · 2026-10-05
- 截图线索显示 OpenAI 或正将后端迁移到 Rust — blixt · 2026-10-05
- SemiAnalysis 绘制中国 60 余家运营商 1000+ 数据中心算力地图 — AccBalanced · 2026-10-05
- 算力资产三重属性:既是地产、也是电力、还是石油 — AccBalanced · 2026-10-05
- UCVG.cpp:一对对比 prompt 即可为任意 LLM 生成控制向量的 C++ 工具 — Egor4more · 2026-10-05
- 单颗 SpaceX Starmind 卫星太阳能功率将超整个国际空间站 — XFreeze · 2026-10-05