Expert-lookahead 让低内存 Mac 跑 MoE 提速 10%

carloslfu · reddit · 2026-09-15

开发者 carloslfu 为低内存 Mac 上的 MoE 模型专家卸载/SSD 流式加载(slotstream)实现了 expert-lookahead 优化,在 Qwen 3.8 flash 上获得 10%+ 的额外性能提升。

核心思路:本想训练小模型提前预测 N 层后的专家,实验后发现模型自身就是最好的预测器——最终采用 N=2,即在当前计算进行时,用当前隐状态提前运行 2 层后的 router,预加载将用到的专家到内存。目前正在训练叠加其上的小修正模型,可再带来约 3-4% 提升。

文档与实现已开源在 slotstream 的 GitHub 仓库。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →