小米 MiMo-V2.6 修复工具调用重复:RL 奖励盲区所致

udmrzn · x · 2026-09-28

小米 MiMo 团队诊断并修复了 MiMo-V2.6 系列模型重复调用相同/相似工具的问题——该 bug 会烧掉上下文并卡死任务,在 MiMo Desktop、MiMo Code 和 OpenCode 中尤为明显。

根因:规模化 RL 中的「奖励盲区」——当奖励只看最终答案正确性时,过程中的低效行为不会被惩罚,反而随训练规模放大。具体是 flooding 惩罚只在每轮 >32 次工具调用时才触发,低于阈值的重复完全不受约束。

修复方案:训练了一个轻量的「重复专项 RL teacher」——仅 12 步、约 7k 样本——再通过 MOPD 合并进主模型,成本约为完整 mixRL 重训的 4%。修复后各 harness 与上下文长度下重复大幅下降,benchmark 保持稳定。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →