Agon:让模型互相打分学推理

Vladislav Beliaev · hf · 2026-07-20

Agon:用对手给对手打分的推理RL

这篇论文指出,像 GRPO 这类基于可验证奖励的强化学习方法,通常只评估最终答案,容易把模型训练成“更会写”而不是“更会想”。为此,作者提出 Agon:一种 双模型对抗式强化学习,让两个模型互相充当裁判。

核心机制

为什么重要

因为两个模型都会被优化,彼此会形成一个持续变强的对手,单模型 RL 很难提供这种压力。推理时,这套系统也会以 两阶段级联 的方式部署:先由一个模型起草,再由另一个模型看完草稿后作答。

结果

作者认为下一步是让两个模型在 latent space 中一起推理,而不是只用文本交流。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →