小米 MiMo-V2.6 修复工具调用重复:RL 奖励盲区,仅花 4% 成本
LegacyRemaster · reddit · 2026-09-28
小米 MiMo 团队诊断并修复了 MiMo-V2.6 系列重复调用相同工具、烧掉上下文并卡死任务的问题(在 MiMo Desktop、MiMo Code、OpenCode 中均出现)。
根因:RL scaling 中的"奖励盲区"——奖励只跟踪最终答案正确性,过程中的低效行为不受惩罚,且随训练规模被放大。具体是 flooding 惩罚仅在每轮超过 32 次工具调用时触发,阈值以下的重复完全无惩罚。
修复:训练了一个轻量的重复专项 RL teacher(仅 12 步、约 7k 样本),通过 MOPD 合并进主模型,成本约为完整 mixRL 重训的 4%。修复后各 harness 与上下文长度下重复大幅下降,基准成绩保持不变。
所属事件:小米 MiMo-V2.6 修复工具调用重复缺陷(2 条相关)→
「编程与Agent」频道最新
- Apodex 1.1 发布:36B 开源 mini 模型可本地部署,附开源 Agent 框架 FrontierAgent — kimmonismus · 2026-09-28
- 开源 MemorySec:让安全应急 agent 记住每次攻防处置经验 — User_0007_123 · 2026-09-28
- 开发者请小主播盲玩新游戏,一晚测出多个 bug — nptacek · 2026-09-28
- 开源工具 EvalSeal v2.2.0:给 LLM 评测盖防篡改回执,实测 5/20 边界判例被 judge 抖动翻转 — Fit_Fortune953 · 2026-09-28
- 阳易:让 agent 监听 Substack 并自动转录 YouTube 文稿 — yangyi · 2026-09-28
- 作者用 AI Agent 一早批量投递 24 篇医学图像论文外联邮件 — wandedob · 2026-09-28