Agon:让模型互相打分学推理
Vladislav Beliaev · hf · 2026-07-20
Agon:用对手给对手打分的推理RL
这篇论文指出,像 GRPO 这类基于可验证奖励的强化学习方法,通常只评估最终答案,容易把模型训练成“更会写”而不是“更会想”。为此,作者提出 Agon:一种 双模型对抗式强化学习,让两个模型互相充当裁判。
核心机制
- 两个模型解同一道题。
- 轮流扮演“写答案的人”和“读对方答案再解题的人”。
- 奖励依据是谁能 更好地推理并战胜对手,从而在训练中隐式评价推理质量。
- 不需要过程标注,也不需要奖励模型。
为什么重要
因为两个模型都会被优化,彼此会形成一个持续变强的对手,单模型 RL 很难提供这种压力。推理时,这套系统也会以 两阶段级联 的方式部署:先由一个模型起草,再由另一个模型看完草稿后作答。
结果
- 在 Qwen3 上的 DeepMath hard split,Agon 的 pass@1 约为 GRPO 的两倍。
- 相比同基座上的未训练 Mixture-of-Agents,提升大约是后者的 8 倍。
- 在 竞赛编程代码 任务以及 Qwen3.5、Gemma 4 等模型家族上也复现了类似顺序。
作者认为下一步是让两个模型在 latent space 中一起推理,而不是只用文本交流。
「研究」频道最新
- HF 工程师争论:非生成任务全用因果注意力是在浪费算力 — antoine_chaffin · 2026-09-11
- 智利学者:AI 反馈规模化是医学教育可持续的关键 — julianvarascom · 2026-09-11
- Nature 新研究实现全身器官细胞活动成像,揭示跨器官体级回路 — arjunrajlab · 2026-09-11
- SignNet 1M 手语数据集发布 — ducha_aiki · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- InFlux++ 方法发布 — ducha_aiki · 2026-09-11