玩家在 64GB Mac mini M5 上本地跑 Qwen Flash Next

Reddit 用户分享在 64GB Mac mini M5 上本地运行 Qwen Flash Next Q4 量化模型的实测:自优化后解码速度约 17.5 tks,提示词处理约 360 tks。由于显存放不下全部 MoE 专家权重,作者采用「热专家留缓存、其余从 SSD 流式加载」的方案,但解码时仍有约 27% 的时间在等待磁盘读取,显示本地跑大 MoE 模型仍受存储带宽制约。

2026-10-05 ~ 2026-10-05 · 2 条相关