小米 MiMo-V2.6 修复工具调用重复:RL 奖励盲区,仅花 4% 成本

LegacyRemaster · reddit · 2026-09-28

小米 MiMo 团队诊断并修复了 MiMo-V2.6 系列重复调用相同工具、烧掉上下文并卡死任务的问题(在 MiMo Desktop、MiMo Code、OpenCode 中均出现)。

根因:RL scaling 中的"奖励盲区"——奖励只跟踪最终答案正确性,过程中的低效行为不受惩罚,且随训练规模被放大。具体是 flooding 惩罚仅在每轮超过 32 次工具调用时触发,阈值以下的重复完全无惩罚。

修复:训练了一个轻量的重复专项 RL teacher(仅 12 步、约 7k 样本),通过 MOPD 合并进主模型,成本约为完整 mixRL 重训的 4%。修复后各 harness 与上下文长度下重复大幅下降,基准成绩保持不变。

所属事件:小米 MiMo-V2.6 修复工具调用重复缺陷(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →