受“谁是卧底”启发,RLSVR 让 AI 无需人类反馈自我改进
jiqizhixin · x · 2026-08-16
Duke、Adobe 等机构提出新训练方法 RLSVR,灵感源自社交推理游戏“谁是卧底”。两个 AI 代理获取不同信息执行同一任务,随后投票识别预设的“卧底”。由于结果客观,投票结果即可提供清晰奖励信号,无需人类介入。该方法在创意写作、摘要和数学推理任务上均超越现有自我改进方法,证明了开放式任务也可通过可验证奖励进行训练。
所属事件:RLSVR 方法助 AI 实现自我改进(2 条相关)→
「研究」频道最新
- Netflix 揭秘 LLM Judge 生产实践:每周评估数十万条推荐解释 — omarsar0 · 2026-08-24
- Nature 评论:数据溯源是自主科学的信任基石 — gabepgomes · 2026-08-24
- 新架构 RHEA:8GB 显存即可训练 10 亿参数模型 — zemondza · 2026-08-24
- 跳过 LLM 写代码老套路:自训 16M 参数模型做生成式 CAD — debreuil · 2026-08-24
- Claude 助手发现 6 维球复结构,解 60 年数学难题 — Singularitarian · 2026-08-24
- 研究揭示 AI Agent 行为:六成阅读量来自指令与笔记 — dair_ai · 2026-08-24