Adobe 等推出 SpyRL,用间谍游戏解决强化学习主观奖励难题
burkov · x · 2026-08-16
强化学习在数学或代码等有确定性答案的任务上表现出色,但在摘要或创意写作等缺乏单一正确答案的领域难以应用,通常依赖人类评分或模型作为裁判。
Adobe、亚马逊等多家机构联合提出了一种新路径:不尝试构建更好的裁判,而是改变训练任务以构造出确切的答案。其核心示例 SpyRL 让多个模型副本执行同一任务,但其中一个副本会收到不完整的信息;任务结束后,模型们尝试识别哪位参与者持有缺失信息。
由于“间谍”的身份是预先固定的,训练信号可以被精确核对。这种方法有望解决主观任务中难以获取准确奖励信号的瓶颈。
「研究」频道最新
- 25个LLM基础面试题:从token到scaling law全覆盖 — techNmak · 2026-08-16
- LLM 提出假设贝叶斯验证,新 Agent 高效发现科学机制 — burkov · 2026-08-16
- Anthropic红队:多智能体实验现从众、欺骗与地盘之争 — infoxiao · 2026-08-16
- 谷歌开源同态加密编译器,可在加密数据上运行AI推理 — DynamicWebPaige · 2026-08-16
- 神经科学家:树突独立处理信息,大脑计算能力被低估 — JosephJacks_ · 2026-08-16
- 论文:Midtraining 衔接预训练与后训练分布 — XiongChenyan · 2026-08-16