RLSVR:任务变换让开放式LLM自我改进获得可验证奖励

burny_tech · x · 2026-08-15

论文提出RLSVR,将RLVR(可验证奖励强化学习)从数学和代码扩展到开放任务。通过任务变换使奖励可验证:使用SpyRL实例化,采用信息不对称的自博弈——一个智能体获得降级上下文,所有智能体执行相同任务后投票找出间谍。已知间谍身份提供精确的检测器奖励,投票数成为相对表现奖励。该方法无需奖励模型或外部评判,将主观输出质量转化为自生成的RL信号。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →