小米 MiMo 疑似首个 1M 上下文 RL 训练,Agent 裁判成新扩展轴
stochasticchasm · x · 2026-09-22
网友点评小米 MiMo 的技术架构("classic mimo architecture, simple and strong"),并指出两点值得关注:
- 这可能是业内首次在 100 万 token 上下文上做强化学习训练(作者自己也不确定,标注存疑);
- 大规模使用 agent 作为裁判(agent-as-a-judge) 是其亮点,其他中国实验室也在采用类似做法——这相当于在 RL 阶段开辟了除算力之外的另一条扩展轴,让奖励判定更稳健。
后续追问中作者猜测 "groupwise" 设置可能指每组一个 agent,从而形成对比式评分,但表示尚待确认。整体属于对训练方法的有根据推测与讨论,未获官方证实。
所属事件:小米 MiMo 疑似首个 1M 上下文 RL 训练,30 步即大幅提升(4 条相关)→
「研究」频道最新
- GRPO 大 batch 训练引技术争论:批评者称缺 batch 规模消融 — stochasticchasm · 2026-09-22
- Will Depue 补充:合成环境训练最大隐患是「黑」世界模型,但有缓解手段 — willdepue · 2026-09-22
- 从 Adam 转向 Muon 中期训练?业界热议预训练优化器切换与 mxfp4 QAT — stochasticchasm · 2026-09-22
- 开发者观点:世界模型做 RL 是被严重低估的研究方向 — willdepue · 2026-09-22
- Cua AI 发布 Cua-Bench-S1 基准与 Cua-S1 系列电脑操作模型 — ycombinator · 2026-09-22
- Real-Time EXPO-FT:异步拆分让慢速 VLA 实现实时操控 — philfung · 2026-09-22