Manifold Muon 提出一种不依赖损失的 MoE 路由训练法
tokenbender · x · 2026-07-25
Varun Neal 介绍了用 Manifold Muon 训练 MoE router 的两种方法,其中一种甚至完全脱离训练损失。
他表示,若只输入显式计算出来的 load-balancing gradient,这个“loss-free”版本单独使用也已经表现不错,只是仍略低于当前 SOTA。配图代码展示了一个很简化的 router step:先算平衡梯度,再做 Manifold Muon 更新。
「研究」频道最新
- Opus 5 在 ARC-AGI 1/2 上进步,疑似靠代数化解题 — herbiebradley · 2026-07-25
- NSF 投资 AI 云实验室网络,推进自主科学研究 — ProfBuehlerMIT · 2026-07-25
- Anthropic 说,Fable 5 拦下的生物请求将转给 Opus 5 — nc_frey · 2026-07-25
- AlphaFold 辅助重设计基因编辑蛋白,降低脱靶风险 — Ars Technica AI · 2026-07-25
- Codex 多智能体编排:Scout、Worker、Coordinator 分工协作 — pvncher · 2026-07-25
- MOJO 预印本:混合监督与自监督损失训练神经基础模型 — hugo_larochelle · 2026-07-25