罗福莉复盘小米 MiMo-V2.6:单步生成 2.5 万条 Agent 轨迹
bookwormengr · x · 2026-09-22
小米罗福莉发布了一篇很长的 MiMo-V2.6 复盘,核心问题是:预训练 Scaling Law 跑了多年之后,RL 能不能也这样 scale——算力、任务、真实环境继续加,能力还能不能跟着涨。小米这半年基本在赌这件事。
RL 规模
- 一次更新抽 1,568 个任务,每个任务同时跑 16 条 rollout,一个 Step 约生成 2.5 万条 Agent trajectory,消耗几十亿 Token。
- Pro 和 Flash 最终都跑了 30 个 Step。
难点一:先要有足够多的「世界」
数学 RL 是一题一答案,对错立判;Agent 要写代码、开浏览器、操作电脑、调用工具、看结果再决定下一步。小米为此扩张了 Environment,做了 7000 多个 RL Task Environment,覆盖 Coding、General Agent、Visual Agent、Cybersecurity 等任务,一条轨迹可能持续几十到几百步。
难点二:Harness 被塞进训练
过去 Harness 被视为模型之外的东西——模型公司训模型,Claude Code、Codex 等产品在外面套 System Prompt。小米这次把 Harness 也纳入训练环节。
(原帖为长文,后续内容未完整给出。)
「编程与Agent」频道最新
- AI 生成的网站被吐槽难懂,他花 4 天手工重设计 UI — maddy30445r · 2026-09-22
- 他给 AI Agent 建了个专属新闻源:Agent 自己读、自己发帖排名 — akash_kloudle · 2026-09-22
- RAG 准确率从 40% 到 90%:先测数据,问题根本不在模型 — max_gladysh · 2026-09-22
- 开发者实测 Jev:多数用例是过度设计,浏览器操作最快 — EXM7777 · 2026-09-22
- Modular 推出 LLM 推理手册,系统讲解 GPU 架构与 kernel 优化 — blaizedsouza · 2026-09-22
- 企业 AI 落地五步法:每步必须产出可见交付物才算完成 — alex_verem · 2026-09-22