95.5GB 的 Qwen 模型塞进 64GB Mac:专家流式加载跑出 27 tok/s

SnooPredictions515 · reddit · 2026-09-19

作者成功在 64GB M5 Pro Mac 上以主模型方式运行 95.5 GiB 的 Qwen3.8-Flash-Next:核心是专家流式加载——MoE 路由专家留在 SSD,只有 token 实际路由到时才读取(基于 mihailescu2m 的工作,需用其 llama.cpp fork,官方版不支持该 flag)。

关键优化与数据:

模型与 fork 均已开源,README 有完整五步安装命令。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →