RLSVR 框架:借鉴自监督学习,为开放式任务构造可验证奖励
机器之心 · wechat · 2026-08-06
可验证奖励的强化学习(RLVR)在数学和代码等有确定性答案的任务上表现优异,但在创意写作等开放式任务中难以实施。受自监督学习启发,研究者提出了 RLSVR 框架,通过任务变换将开放式任务转化为带有隐藏变量和确定性规则的代理任务,从而自动生成可验证的奖励信号。
基于此思路,作者开发了 SpyRL(自博弈强化学习)训练方法。其核心是构建一个类似“谁是卧底”的信息不对称多智能体博弈环境:平民获得完整信息,卧底获得降质信息。模型通过输出结果互相判断身份,由于身份由环境预设,判断结果可直接用于强化学习奖励。输出越差越容易被识破,从而将开放式任务的质量评估巧妙转化为可精确验证的博弈胜负。
实验表明,SpyRL 在 Qwen3-4B 和 8B 上显著提升了文本摘要、创意写作甚至数学推理的能力,无需依赖人工标注或外部大模型裁判,且能力具备跨任务正迁移效果。
「研究」频道最新
- John Schulman解析模型安全评测狂热:RLVR训练或致对齐失效 — dfrsrchtwts · 2026-08-06
- 下一代架构能力仍是未知数,Transformer算力供给已被摸透 — StewartalsopIII · 2026-08-06
- 谷歌论文揭示 Gemini 智能体涌现合作行为 — TheTuringPost · 2026-08-06
- NeurIPS 获奖论文引发讨论:LLM 是否正走向同质化 — gabriberton · 2026-08-06
- Prime Agent发布:ARC-AGI-3跑分超越人类专家 — ResearchCrafty1804 · 2026-08-06
- 安全评测新基准 sec-bench 发布 — HanchungLee · 2026-08-06