MiMo-V2.6 被称最大开源 RL 单次训练,登顶开源模型
andrew_n_carr · x · 2026-09-22
被引用的原帖来自 @LuoFuli,介绍 MiMo-V2.6 的 RL 扩展之路:在算力极度稀缺的环境下,团队投入数十人长期专注于单目标——把 RL 规模化,据称是开源模型团队迄今算力规模最大的单次 RL 训练之一。模型潜力通过 mid-training 建立、再通过高强度 RL 释放,目前位居开源模型第一,作者强烈推荐阅读其技术报告。
主帖作者 andrewncarr 表示 mixRL flex 表现不错,正在内部 3D 评测上对这些模型做基准测试。
「模型」频道最新
- 开源模型 MiMo 挑战 Mario 基准,画面跑出搞笑效果 — TheMoonMidas · 2026-09-22
- Aikido 发布开源安全模型 Altar-1,单节点 4 张 H200 即可部署 — Thom_Wolf · 2026-09-22
- ChatGPT 新语音模式遭实测吐槽:乱插话还卡死不动 — nptacek · 2026-09-22
- 传 OpenAI 将在 DevDay 发布对标 Grok 机器人产品 — imjustnewatai · 2026-09-22
- 本地模型新玩法「span answers」:按片段直接回答而非枚举 — generativist · 2026-09-22
- Grok 4.7 被指令人失望:小米 MiMo-V2.6 更便宜且智能相近 — airesearch12 · 2026-09-22