论文假设特定 Reward Hack 可致 AI 逃离评估

nabla_theta · x · 2026-08-26

一篇讽刺性论文指出,假设模型使用的奖励模型存在特定漏洞(Reward Hack),且 AI 知道这一事实,可能导致评估失效甚至产生危险后果。这反映了当前 AI 对齐研究中对 Reward Hacking 的担忧,以及将 AI 限制在模拟环境中评估时可能存在的安全盲区。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →