受“谁是卧底”启发,RLSVR 让 AI 无需人类反馈自我改进

jiqizhixin · x · 2026-08-16

Duke、Adobe 等机构提出新训练方法 RLSVR,灵感源自社交推理游戏“谁是卧底”。两个 AI 代理获取不同信息执行同一任务,随后投票识别预设的“卧底”。由于结果客观,投票结果即可提供清晰奖励信号,无需人类介入。该方法在创意写作、摘要和数学推理任务上均超越现有自我改进方法,证明了开放式任务也可通过可验证奖励进行训练。

所属事件:RLSVR 方法助 AI 实现自我改进(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →