Muon 优化器在小型超人类智能体上大幅超越 Adam
Kimi 研究员 jsuarez 澄清其工作并非针对 LLM,而是在游戏、无人机、驾驶、商业模拟等多种任务上训练小型超人类智能体。在两组均经过完整超参扫描的前提下,Muon 优化器在这些任务上大幅超越 Adam。YouJiacheng 进一步提出假设:通过自由探索训练的强 RL 智能体行为比文本更多样,因此比 LLM 预训练更能受益于 Muon,甚至可能改善探索效率。
2026-08-29 ~ 2026-08-29 · 2 条相关
- Kimi 研究员:Muon 在小型超人类智能体上大幅超越 Adam — jsuarez · 2026-08-29
- 观点:强 RL 智能体通过自由探索产生更多样化行为 — YouJiacheng · 2026-08-29