小米提出 GAGAR:智能体评分重分配优势,改进代码 Agent RL 训练
XiaomiMiMo · hf · 2026-09-29
小米 MiMo 团队发布 GAGAR 框架,针对代码智能体强化学习中 GRPO 的一个核心缺陷:同一组内所有通过测试的轨迹获得相同优势值,无法区分实现质量高低。
方法要点
- 基于动态采样,保留同时含通过/失败轨迹的组
- 用 SFT 训练的智能体评分器(agentic grader)把同组所有轨迹放入共享工作区联合审查,对通过测试的候选排序
- 按排序下调低质量轨迹权重,并对全部通过轨迹的优势值做保和重缩放,把信用向高质量实现倾斜
实验结果
- 在 MiMo-V2.6-Flash(310B)与 MiMo-V2.6-Pro(1.02T)的 pre-RL SFT 检查点上工业级验证
- Flash 的纯代码对照实验显示:代码 agent 性能提升、轨迹长度增长减少、训练更稳定
- 并进一步在大规模混合任务 RL 中应用于 Flash 与 Pro
结论:测试验证与组内智能体评分结合,可提升代码 agent RL 的质量与稳定性。
「编程与Agent」频道最新
- 开源 VeriChron AI:用双时态数据重建任意时点的企业合规状态 — LoksaiPalyam · 2026-09-29
- 让 AI 写架构决策记录:Staff 工程师的选择题 prompt 模板 — JafarNajafov · 2026-09-29
- 「像福尔摩斯一样调试」prompt:先列 5 个根因再动手修 — JafarNajafov · 2026-09-29
- 别把 Claude 当 Stack Overflow 用:11 个可直接复制的编码 prompt — JafarNajafov · 2026-09-29
- 视频转写纠错思路:抽音抽帧+ASR+前沿模型结合画面修正 — capetorch · 2026-09-29
- bdsqlsz 近期用 vibe coding 训练 DLSS5 权重,为自研 3D 游戏做准备 — bdsqlsz · 2026-09-29