Adobe 等推出 SpyRL,用间谍游戏解决强化学习主观奖励难题

burkov · x · 2026-08-16

强化学习在数学或代码等有确定性答案的任务上表现出色,但在摘要或创意写作等缺乏单一正确答案的领域难以应用,通常依赖人类评分或模型作为裁判。

Adobe、亚马逊等多家机构联合提出了一种新路径:不尝试构建更好的裁判,而是改变训练任务以构造出确切的答案。其核心示例 SpyRL 让多个模型副本执行同一任务,但其中一个副本会收到不完整的信息;任务结束后,模型们尝试识别哪位参与者持有缺失信息。

由于“间谍”的身份是预先固定的,训练信号可以被精确核对。这种方法有望解决主观任务中难以获取准确奖励信号的瓶颈。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →