小米 MiMo 疑似首个 1M 上下文 RL 训练,30 步即大幅提升

网友点评小米 MiMo 采用「经典架构,简单而强大」,并指出两点值得关注:这可能是业内首次在 1M 上下文上进行 RL 训练,同时 Agent 裁判正成为新的扩展轴。训练使用了极大的批次规模——每步 1568 个任务、每个任务 16 个 rollout,消耗大量 token。研究者 stochasticchasm 表示最意外的是模型仅经约 30 步强化学习就取得戏剧性提升,远少于预期步数,且尚未见平台期。

2026-09-22 ~ 2026-09-22 · 4 条相关

另有 1 条近重复转述:stochasticchasm