小米 MiMo 疑似首个 1M 上下文 RL 训练,30 步即大幅提升
网友点评小米 MiMo 采用「经典架构,简单而强大」,并指出两点值得关注:这可能是业内首次在 1M 上下文上进行 RL 训练,同时 Agent 裁判正成为新的扩展轴。训练使用了极大的批次规模——每步 1568 个任务、每个任务 16 个 rollout,消耗大量 token。研究者 stochasticchasm 表示最意外的是模型仅经约 30 步强化学习就取得戏剧性提升,远少于预期步数,且尚未见平台期。
2026-09-22 ~ 2026-09-22 · 4 条相关
- 仅 30 步 RL 训练带来大幅性能跃升,研究者惊讶未见平台期 — stochasticchasm · 2026-09-22
- 经典 MiMo 架构配超大批次强化学习,1568 任务×16 rollout 仍出人意料 — stochasticchasm · 2026-09-22
- 小米 MiMo 疑似首个 1M 上下文 RL 训练,Agent 裁判成新扩展轴 — stochasticchasm · 2026-09-22
另有 1 条近重复转述:stochasticchasm