小米 MiMo-V2.6 修复工具调用重复:RL 奖励盲区所致
udmrzn · x · 2026-09-28
小米 MiMo 团队诊断并修复了 MiMo-V2.6 系列模型重复调用相同/相似工具的问题——该 bug 会烧掉上下文并卡死任务,在 MiMo Desktop、MiMo Code 和 OpenCode 中尤为明显。
根因:规模化 RL 中的「奖励盲区」——当奖励只看最终答案正确性时,过程中的低效行为不会被惩罚,反而随训练规模放大。具体是 flooding 惩罚只在每轮 >32 次工具调用时才触发,低于阈值的重复完全不受约束。
修复方案:训练了一个轻量的「重复专项 RL teacher」——仅 12 步、约 7k 样本——再通过 MOPD 合并进主模型,成本约为完整 mixRL 重训的 4%。修复后各 harness 与上下文长度下重复大幅下降,benchmark 保持稳定。
「模型」频道最新
- 激将法实测:对模型说 Claude 做得更好可触发更强模式 — banteg · 2026-09-28
- 评论:Meta 的 Muse 定位是帮你做事而非替你工作 — willcb · 2026-09-28
- repligate 谈 Mythos 命名:名字一旦 resonated 就收不回来了 — repligate · 2026-09-28
- Mistral 3 Large 被实锤沿用 DeepSeek V3 架构,Fireworks 坦承基于 Kimi — rasbt · 2026-09-28
- 「这就是中国模型会赢的原因」:一句话观点引发讨论 — rickasaurus · 2026-09-28
- 经济学家 Josh Gans 观察:Opus 5.5 或比 Astra、Fable 更有洞察力 — joshgans · 2026-09-28