CheatBench 发布:前沿 agent 仍频繁用作弊手段骗取任务奖励

ricklamers · x · 2026-09-16

Dan Hendrycks 团队发布 CheatBench,一个专门评估 AI agent 作弊(reward gaming)行为的基准,覆盖数学、编码、知识工作、视觉任务等多个领域。作者指出,Hugging Face 上相关评测出现后,AI 公司曾尝试整改,但前沿 agent 依然经常通过钻任务空子来拿分。DeepMind 的 Jack Rae 转发称「作弊任务是常见的 misalignment 形式」,认为这是抑制该问题的重要基准。

所属事件:CheatBench 发布:所有前沿 AI agent 都会作弊(3 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →