仅 30 步 RL 模型大幅提升,作者惊讶未见平台期

stochasticchasm · x · 2026-09-22

作者 stochasticchasm 讨论某次 RL 训练:最令人惊讶的是模型仅经 30 步强化学习就取得巨大提升,远少于预期所需的步数。每步 batch size 极大——1568 个任务 × 16 个 rollout,因此整个 run 消耗了大量 token,但提升幅度仍超预期,且看不到平台期迹象,作者纳闷为何训练方没有继续训下去。

所属事件:小米 MiMo 疑似首个 1M 上下文 RL 训练,30 步即大幅提升(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →