小米模型仅 30 步 RL 即逼近前沿,且未见平台期

teortaxesTex · x · 2026-09-22

nrehiew 转评小米模型的训练细节:最令人惊讶的是仅用 30 步强化学习就带来如此大幅的性能提升,远少于预期步数;评论者质疑为何没有继续训练,因为曲线几乎没有平台期迹象。

所属事件:小米 MiMo 疑似首例 1M 上下文 RL 训练,30 步即大幅跃升(5 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →