Qwen3.8-Flash-Next 仅用 37GB 显存运行全专家

EyalToledano · x · 2026-08-29

作者分享了一项针对 Qwen3.8-Flash-Next 模型的 MoE 推理优化突破。他将 60% 的专家权重存储在磁盘上,并按需流式传输到内存(类似 n-gram streaming 技术)。

实测显示,在使用全部专家(无剪枝)的情况下,仅需 37GB 内存即可在 M4 Max 上以 40 tok/s 的速度进行解码。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →