SpyRL借「谁是卧底」自博,把开放任务的不可验证目标变成可验证奖励

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu, Bo Liu, Qingyun Wu, Hai Helen Li, Yiran Chen, Handong Zhao, Wentian Zhao

COLM 2026

cs.AI

2026-07-27

RLVR只对数学/编程等可判对错的任务有效。SpyRL把开放任务变成「找卧底」博弈,卧底身份由环境指定、投票天然可验证,免外部裁判,摘要与数学全面超自演化基线。

这篇在解决什么

RLVR(可验证奖励的强化学习)是最近推理模型爆发的引擎,OpenAI o1、DeepSeek-R1 都靠它。它的道理很简单:数学题、编程题能自动判对错,这个判官给的是无偏、无限、几乎免费的监督信号,所以能大规模训。

但 RLVR 只在「对错可判定」的领域管用。摘要、创意写作这类开放任务,真正的质量函数没有判官;以往做法是塞个奖励模型或 LLM 裁判来近似,代价是引入评判偏差、模型上限被裁判能力卡住、每次生成都要额外推理。

方法

作者借了自监督学习的老招数。自监督不靠人标标签,而是把任务改造成一个 pretext(比如遮词预测),标签从数据里自动生成。RLSVR 把这招从「标签」搬到了「奖励」:把原始开放任务变换成一个代理环境,环境偷偷注入一个隐变量 z(比如「谁是卧底」),z 只有环境知道、不告诉策略;环境的规则提出一个只能靠任务输出来回答的关于 z 的问题,答对答错就是可验证奖励。z 是环境自己采的,真值天然存在,跟数学题对答案一个道理。

SpyRL 是这套框架的一个实例,灵感来自社交推理游戏「谁是卧底」。每轮 n−1 个「平民」拿完整信息、1 个「卧底」拿被损坏的信息(比如原文被遮掉 20%),都就同一个任务产出输出。然后所有玩家投票猜谁是卧底。因为卧底身份是环境指定的,投票对错可验证。表现阶段奖励等于收到怀疑票数的倒数(输出越好、越不招怀疑),检测阶段奖励等于投对了没有。两个阶段交替优化,一组内用 GRPO 式相对优势。

一个关键细节是 RAE(角色优势估计):卧底天然信息吃亏,原始奖励跟平民不可比,所以各自减去角色基线再比。消融显示,去掉 RAE 模型不进反退(平均 50.4 掉到 37.5,比不训还差)。

结果

主干用 Qwen3-4B/8B,三个域:摘要(GovReport,遮 20%)、创意写作(WritingPrompts,遮 20%)、数学(Nemotron-CC-Math,遮 40%),组大小 n=5,100 epoch。基线是 R-Zero、Absolute Zero 两个自演化框架。

任务指标SpyRL最强基线
摘要 GovReportROUGE-L36.733.2(Absolute Zero)
数学 AIME25准确率20.013.4
推理 GPQA-D准确率41.335.3
创意写作(人评)总体胜率80.0%对 Qwen3-4B

摘要上 SpyRL 在所有基准、两个主干上都拿最高 ROUGE-L,A/B 测试三十个格子赢多数;创意写作每个细粒度维度都领先,新颖性、情感提升最大,十名博士生的人评也确认。数学和推理上,五个数学基准加两个推理基准全部最优,AIME 这类难题提升尤其明显。论文还验证了奖励对齐:得票越多,输出质量(GPT-4o 排序)越差,正相关性成立,说明「票数」这个代理奖励确实跟真实质量挂钩,不需要外部裁判。

跟用裁判当奖励(rubric-as-reward)的方法比,SpyRL 不用裁判还更省钱:用 Qwen3.5-27B 当裁判约多花 200 美元、GPT-4o 约 900 美元,而 SpyRL 总体胜率不输甚至更高。

为什么重要

RLVR 的「可验证」边界一直是它打不进开放任务的根因。这篇给了一个干净、可推广的绕法:不去近似那个不存在的质量判官,转而造一个真值天然存在的新问题。对做大模型自我提升和 post-training 的人,这是个值得跟进的方向,而且 SpyRL 的「组内多人竞争」比单 proposer-solver 更能压制裁判偏差。

局限与存疑

表现阶段的奖励仍是「票数」这个代理,论文用相关性验证了它跟质量挂钩,但不是直接验证质量,稳妥的质疑仍成立。迁移不对称:数学训出来的模型迁移到写作是负迁移(摘要和写作则正迁移)。整个游戏每任务还要手配一个信息损坏算子 g(·),虽然消融显示 20% 和 40% 遮蔽几乎无差别,但它仍是任务相关组件。另外评估里大量 A/B 仍靠 GPT-4o 判(虽配了人评),存在循环论证的风险。

术语

原文与代码

社区讨论

相关论文

全部论文解读