Manifold Muon 提出一种不依赖损失的 MoE 路由训练法

tokenbender · x · 2026-07-25

Varun Neal 介绍了用 Manifold Muon 训练 MoE router 的两种方法,其中一种甚至完全脱离训练损失。

他表示,若只输入显式计算出来的 load-balancing gradient,这个“loss-free”版本单独使用也已经表现不错,只是仍略低于当前 SOTA。配图代码展示了一个很简化的 router step:先算平衡梯度,再做 Manifold Muon 更新。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →