开放任务奖励靠评审 agent?开放场景下的 reward hacking 之辩

willcb · x · 2026-09-27

willcb 回应 bayeslord 关于开放场景下 reward hacking 的疑问:开放式任务的奖励通常由另一个 agent 按相对清晰的好坏标准给出;reward hacking 仍然可能,但随着模型更聪明、更鲁棒会变得更难。

所属事件:开放任务奖励由评审 agent 给出,reward hacking 引热议(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →