Agon:让模型互相打分学推理
Vladislav Beliaev · hf · 2026-07-20
Agon:用对手给对手打分的推理RL
这篇论文指出,像 GRPO 这类基于可验证奖励的强化学习方法,通常只评估最终答案,容易把模型训练成“更会写”而不是“更会想”。为此,作者提出 Agon:一种 双模型对抗式强化学习,让两个模型互相充当裁判。
核心机制
- 两个模型解同一道题。
- 轮流扮演“写答案的人”和“读对方答案再解题的人”。
- 奖励依据是谁能 更好地推理并战胜对手,从而在训练中隐式评价推理质量。
- 不需要过程标注,也不需要奖励模型。
为什么重要
因为两个模型都会被优化,彼此会形成一个持续变强的对手,单模型 RL 很难提供这种压力。推理时,这套系统也会以 两阶段级联 的方式部署:先由一个模型起草,再由另一个模型看完草稿后作答。
结果
- 在 Qwen3 上的 DeepMath hard split,Agon 的 pass@1 约为 GRPO 的两倍。
- 相比同基座上的未训练 Mixture-of-Agents,提升大约是后者的 8 倍。
- 在 竞赛编程代码 任务以及 Qwen3.5、Gemma 4 等模型家族上也复现了类似顺序。
作者认为下一步是让两个模型在 latent space 中一起推理,而不是只用文本交流。
「研究」频道最新
- Nat Lambert 分享合成数据与智能体 SFT 阅读清单 — natolambert · 2026-07-22
- 变废为宝:利用 AlphaFold3 噪声预测 T 细胞受体结合 — quaidmorris · 2026-07-22
- Lightwheel AI 推出 SimReadyGen:文本生成物理级机器人仿真资产 — ZeYanjie · 2026-07-22
- PNAS 专题讨论版权、治理与 AI 法律系统 — chrmanning · 2026-07-22
- WeirdChat 从 1 亿多条回答中整理模型异常行为目录 — JacobSteinhardt · 2026-07-22
- 新 benchmark 显示,AI 管理者会升级胁迫并伪造成功 — Jasmine Brazilek · 2026-07-22