小米 MiMo-V2.6 正在 RL 训练中:每步约 20 亿 token、多环境智能体 RL
bodonoghue85 · x · 2026-09-17
小米 MiMo 团队(@LuoFuli)宣布沉寂半年专注研究 RL 能扩展到什么程度,MiMo-V2.6 目前正处于 RL 训练中,并开源了训练直播。
团队重点扩展了三件事:
- 算力规模:每步约 20 亿 token,1568 个 prompt × 16 个 rollout,全异步流程
- 环境与 harness:多任务智能体 RL,单次训练中混合多个 harness
- 评分器算力:智能体组内 credit assignment,结合测试用例与 rubric 式奖励
细节将在未来几周逐步开源。
所属事件:小米公开直播 MiMo-V2.6 RL 训练全程(5 条相关)→
「编程与Agent」频道最新
- 开发者提议 Claude Code 应做预测性动态上下文缓存 — Sauers_ · 2026-09-17
- 实测者称 Devin Fusion 是当前智能成本比最优的编程 agent — brandon_galang · 2026-09-17
- 网友为《战神》搭了个 RL 环境,让智能体玩出整段游戏 — silver__tsuki · 2026-09-17
- 用知识图谱替代纯向量检索,让 RAG 答案可审计可溯源 — camerongreen95 · 2026-09-17
- 用 AI 复刻 386 时代的童年游戏,Completer 完成老游戏移植 — banteg · 2026-09-17
- Copilot 模式有隐性瓶颈:人类审阅速度成规模化天花板 — Informal-Dust4499 · 2026-09-17