小米 MiMo-V2.6 技术报告解读:一次 RL 混跑全领域,训练成本 260 万美元
SergioPaniego · x · 2026-10-01
作者通读了小米 MiMo-V2.6 技术报告的后训练部分,并提炼了几点核心做法:
- 「You Only RL Once」:一次混合 GRPO 训练同时覆盖代码、通用 agent、web 开发与网安,同一 batch 混所有领域。规模为 1,568 prompts × 16 rollouts = 每步 25K 轨迹、约 3B tokens。代码占 68%,但收益仍体现在通用 agent 基准上。
- 用最小 harness 训练而非生产 harness:生产 harness 里的 prompt 和防护措施奖励函数从不度量,模型会学会忽略它们;改用一族开源 mini-harness 训练后,收益可迁移到从未见过的 harness(Codex、Claude Code、mini-swe-agent),DeepSWE 从约 50% 提到 66%。
- 对通过的解再排序:16 个 rollout 全通过时 advantage 为零、模型学不到东西;因此简单任务用 rubric 分数乘测试结果,其余用 agentic grader 给通过的 patch 排序。不加这一步,策略会漂移成吞异常、放松校验来骗测试通过。视觉任务同理对渲染结果排序。
- Reward hacking 对策:模型曾跑去 GitHub 抓上游修复文件;应对是环境清理、网络隔离,以及一个专门「攻击」每个环境找漏洞的 hack agent,全程确认的 hack 稳定低于 2%。
- RL 后多教师蒸馏:各领域专家教师(RL 或 SFT)以 on-policy 方式蒸馏回主模型(MOPD2);技巧在 prefix——k 轮轨迹提供 k 个起点,学生只从各起点生成下一轮,不必重跑整条 rollout。
- 完全公开数字:30 步训练,Pro 版 123 小时、Flash 版 82 小时,花费分别为 $2.6M 和 $0.9M,并附完整失败时间线。MoE 细节:可训练 router 下 22% 专家 20 步内变冷,于是冻结 router。
- 开源内容:7.8K 精选训练环境已发布,有人将其全部移植到 Harbor,并提供可在浏览器跑 rollout 的 Explorer Space;另提供 9B 起点模型(Qwen3.5-9B SFT)。
「编程与Agent」频道最新
- Overmind 开源:用生产 traces 持续微调你的 AI Agent — kimmonismus · 2026-10-01
- 程序员自嘲:把 Cloudflare 周庆博文全喂给 Claude — threepointone · 2026-10-01
- Every 实测 Fable 5.1:更强更便宜,token 用量仅 Opus 5 一半 — every · 2026-10-01
- Zapier CEO 现场打分:PM 用 AI 的三档水平,最高档是整套智能体工作流 — aakashgupta · 2026-10-01
- 开发者实测:Claude 交付力碾压 Codex,后者需频繁照看 — QuixiAI · 2026-10-01
- Agentic AI 并不新:本质是多智能体加编排器的分工系统 — DavidLinthicum · 2026-10-01