罗福莉复盘小米 MiMo-V2.6:单步生成 2.5 万条 Agent 轨迹

bookwormengr · x · 2026-09-22

小米罗福莉发布了一篇很长的 MiMo-V2.6 复盘,核心问题是:预训练 Scaling Law 跑了多年之后,RL 能不能也这样 scale——算力、任务、真实环境继续加,能力还能不能跟着涨。小米这半年基本在赌这件事。

RL 规模

难点一:先要有足够多的「世界」

数学 RL 是一题一答案,对错立判;Agent 要写代码、开浏览器、操作电脑、调用工具、看结果再决定下一步。小米为此扩张了 Environment,做了 7000 多个 RL Task Environment,覆盖 Coding、General Agent、Visual Agent、Cybersecurity 等任务,一条轨迹可能持续几十到几百步。

难点二:Harness 被塞进训练

过去 Harness 被视为模型之外的东西——模型公司训模型,Claude Code、Codex 等产品在外面套 System Prompt。小米这次把 Harness 也纳入训练环节。

(原帖为长文,后续内容未完整给出。)

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →