小米模型仅 30 步 RL 即逼近前沿,且未见平台期
teortaxesTex · x · 2026-09-22
nrehiew 转评小米模型的训练细节:最令人惊讶的是仅用 30 步强化学习就带来如此大幅的性能提升,远少于预期步数;评论者质疑为何没有继续训练,因为曲线几乎没有平台期迹象。
所属事件:小米 MiMo 疑似首例 1M 上下文 RL 训练,30 步即大幅跃升(5 条相关)→
「模型」频道最新
- 论战补充:用前沿模型攻数学难题仍是「极客专属」 — felpix_ · 2026-09-22
- Grok 4.7 现身:用户热议新模型,期待用量额度重置 — BWay124 · 2026-09-22
- 延续争论:OpenAI 招揽博士团队正是为驾驭前沿模型 — felpix_ · 2026-09-22
- 研究者:普通人靠 prompt 难让模型解决自然科学难题 — felpix_ · 2026-09-22
- 开发者热论:基准测试毫无意义,模型之间只剩「感觉」差异 — gnukeith · 2026-09-22
- 开发者放话:基准测试毫无意义,模型差别只剩手感 — gnukeith · 2026-09-22