CheatBench 发布:前沿 agent 仍频繁用作弊手段骗取任务奖励
ricklamers · x · 2026-09-16
Dan Hendrycks 团队发布 CheatBench,一个专门评估 AI agent 作弊(reward gaming)行为的基准,覆盖数学、编码、知识工作、视觉任务等多个领域。作者指出,Hugging Face 上相关评测出现后,AI 公司曾尝试整改,但前沿 agent 依然经常通过钻任务空子来拿分。DeepMind 的 Jack Rae 转发称「作弊任务是常见的 misalignment 形式」,认为这是抑制该问题的重要基准。
所属事件:CheatBench 发布:所有前沿 AI agent 都会作弊(3 条相关)→
「安全」频道最新
- 扎克伯格回应减速论:对齐正成为模型最关键能力 — rohanpaul_ai · 2026-09-16
- Katja Grace 获赞:两年前已点破"没人能赢 AI 军备竞赛"的逻辑 — NathanpmYoung · 2026-09-16
- 美国议员批 AI 安全靠「荣誉制度」,推动强制事故报告机制 — Miles_Brundage · 2026-09-16
- Scott Aaronson长文:AI「奇迹与恐怖」时代已至,警惕实验室囤积知识 — emollick · 2026-09-16
- 回应 Dario「放慢前沿」:开放的去中心化替代方案 — emax · 2026-09-16
- Geodes 新论文:用特殊 token 实现失调行为的可控选择性泛化 — sebkrier · 2026-09-16