小米提出 GAGAR:智能体评分重分配优势,改进代码 Agent RL 训练

XiaomiMiMo · hf · 2026-09-29

小米 MiMo 团队发布 GAGAR 框架,针对代码智能体强化学习中 GRPO 的一个核心缺陷:同一组内所有通过测试的轨迹获得相同优势值,无法区分实现质量高低。

方法要点

实验结果

结论:测试验证与组内智能体评分结合,可提升代码 agent RL 的质量与稳定性。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →