新方法实现MoE模型提前路由,大幅优化端侧流式推理I/O瓶颈

dai_app · reddit · 2026-08-01

一位开发者在探索将大型 MoE 模型流式传输到手机等低算力边缘设备时,提出了一种突破性的 I/O 优化方案。

核心痛点:在 MoE 架构中,模型需要通过路由实时判断调用哪些专家,但如果所需的专家未缓存在内存中,就会因闪存读取(I/O)延迟严重拖慢推理速度。

解决方案:作者提出利用当前层(L)的前 n 层的隐藏状态,结合 L 层自身的路由权重,提前 n 层预测并预取所需的专家。这样在计算到达 L 层时,所需专家已加载完毕,从而将 Token 生成速度的瓶颈完全转移至纯算力层面。

初步成效:最令人惊讶的是,这种跨越多层的前置预测路由不仅没有导致模型质量下降,初步测试显示生成质量似乎完全不受影响。作者计划近期公开相关研究数据,并正在寻求社区对类似预测性预取项目的讨论与反馈。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →