小米 MiMo v2.6 发布,深度解析其 RL 训练三大 scaling 变量
tokenbender · x · 2026-09-22
小米发布 MiMo v2.6,tokenbender 发长线程深度解读其以强化学习为核心的技术路线。
论文核心思路是显式 scale 三件事:
- batch size 与吞吐:主张从吞吐量和 GPU 扩展便利性的角度选用大 batch
- 环境多样性:扩大 RL 训练环境的覆盖面
- grader 算力:加大奖励评分环节的计算投入
帖子逐一讨论这些选择的动机与权衡,是理解当前 RL 后训练 scaling 实践的较好材料。
所属事件:小米发布 MiMo v2.6,RL 三要素扩规模成核心看点(6 条相关)→
「模型」频道最新
- Claude Code 用量重置会同时保留全球与银行式重置? — Angaisb_ · 2026-09-22
- Anthropic「宪法」被指名不副实:本质就是 RLAIF 省人力标注 — WillRinehart · 2026-09-22
- 云栖大会爆料:Qwen4 已在训练,Qwen4.5/5 将冲 5-10 万亿参数 — ChrisGPT · 2026-09-22
- 逆向 Splash 包格式移植 Qwen3.8-27B,M5 Max 上 64k 上下文解码近 88 tok/s — SeveralViolins · 2026-09-22
- Fable 新行为:可打断当前回答先答新问题再继续 — gleech · 2026-09-22
- OpenAI 纳维-斯托克斯证明被指钻了题设漏洞 — joshgans · 2026-09-22