RLSVR 方法助 AI 实现自我改进

Duke 和 Adobe 等机构受“谁是卧底”游戏启发提出 RLSVR 方法,通过两个 AI 代理执行任务并互相投票,解决了强化学习在创意写作等主观任务中缺乏人类反馈的难题。

2026-08-16 ~ 2026-08-16 · 2 条相关