SpyRL:用「谁是卧底」机制让大模型实现开放式自我纠错

Qinsi Wang · hf · 2026-08-03

为了突破强化学习在数学和编程等可验证领域之外的瓶颈,研究者提出了 RLSVR(自验证奖励强化学习)范式。该方法通过任务转换,将开放式任务转化为可自动生成奖励信号的环境。

团队基于「谁是卧底」游戏机制实例化了 SpyRL 多智能体自博弈环境。智能体获得不对称信息并完成目标任务,通过投票识别预定的卧底。由于卧底身份已知,投票结果能提供完全可验证的奖励,而成功识别又与输出质量高度相关。

在文本摘要、创意写作和数学推理任务上的实验表明,SpyRL 在不可验证任务上优于现有自我改进方法,并在可验证推理任务上保持一致提升。

所属事件:新研究提出 RLSVR 范式实现大模型开放式自我纠错(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →