小米 MiMo 疑似首个 1M 上下文 RL 训练,Agent 裁判成新扩展轴

stochasticchasm · x · 2026-09-22

网友点评小米 MiMo 的技术架构("classic mimo architecture, simple and strong"),并指出两点值得关注:

后续追问中作者猜测 "groupwise" 设置可能指每组一个 agent,从而形成对比式评分,但表示尚待确认。整体属于对训练方法的有根据推测与讨论,未获官方证实。

所属事件:小米 MiMo 疑似首个 1M 上下文 RL 训练,30 步即大幅提升(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →