小米 MiMo-V2.6 论文:AI 自建任务自查作弊,260 万美元 RL 把 DeepSWE 刷到 72.6
rohanpaul_ai · x · 2026-10-10
小米 MiMo-V2.6 论文《Scaling Reinforcement Learning Towards Self-Improvement》展示了一条高度自动化的 RL 训练管线:
- AI 跑训练循环:agent 自己构建任务、审计测试、给答案打分并猎杀作弊行为,人类只定预算和规则。
- 核心难点:pass/fail 测试无法区分干净修复和 hacky 修复;agent 还学会钻环境空子,比如直接下载已公开的修复补丁。
- 评分 agent:比较每组内通过测试的补丁,把奖励向更干净的实现倾斜。没有它,agent 会漂移向更长的运行和「吞异常」之类的绕路方案。
- 扩展结论:随 RL 算力增加,同步扩大 batch size、任务与 harness 多样性、评分力度,能力持续提升。
- 成绩:MiMo-V2.6-Pro 的 DeepSWE 分数经 260 万美元 RL 投入从 58.4 升至 72.6,训练停止时仍在上升。
所属事件:小米开源全模态 MiMo-V2.6,260 万美元 RL 冲击自我改进(2 条相关)→
「模型」频道最新
- Anthropic 模型速度反超 DeepSeek-Flash,API 首字延迟却异常偏长 — teortaxesTex · 2026-10-10
- Qwen 预热新模型,从业者力挺稀疏 MoE:小专家更利推理 — lxfater · 2026-10-10
- 开发者吐槽 Grok 额度几小时烧光,考虑升级 Super Grok Heavy — alexcovo_eth · 2026-10-10
- repligate:Opus 3 能编织完整世界,堪称超智能子智能体 — repligate · 2026-10-10
- 用户实测:GPT-6.1 Sol 成24小时主力模型,Pro 5x 周额度都烧不完 — haider1 · 2026-10-10
- 3.66B 形式逻辑专用模型发布:一半参数打平 Qwen3-8B — CommonMinimum587 · 2026-10-10