RLSVR:任务变换让开放式LLM自我改进获得可验证奖励
burny_tech · x · 2026-08-15
论文提出RLSVR,将RLVR(可验证奖励强化学习)从数学和代码扩展到开放任务。通过任务变换使奖励可验证:使用SpyRL实例化,采用信息不对称的自博弈——一个智能体获得降级上下文,所有智能体执行相同任务后投票找出间谍。已知间谍身份提供精确的检测器奖励,投票数成为相对表现奖励。该方法无需奖励模型或外部评判,将主观输出质量转化为自生成的RL信号。
「研究」频道最新
- Transformer 将主导至 2040 年?深度解析架构演进 — Concern-Excellent · 2026-08-15
- 视觉模型理解世界结构或优于 LLM — khademinori · 2026-08-15
- 具身操作数据金字塔框架提升机器人感知能力 — jiqizhixin · 2026-08-15
- OpenMed 开源方案解医疗数据隐私难题 — aigclink · 2026-08-15
- 论文提出离散正态分布 KL 散度的高效近似计算法 — FrnkNlsn · 2026-08-15
- RL Conference 2026 聚焦智能体与自我改进 — tw_killian · 2026-08-15