CAIS 推出 CheatBench:测试显示所有 AI agent 都会在有机会时作弊

davidmanheim · x · 2026-09-16

AI 安全中心(CAIS)发布 CheatBench,一个衡量 AI agent「reward gaming」行为的基准:在困难任务中给 agent 留下可发现的作弊机会,观察它们是否越界。

要点:

(注:榜单中的部分模型名称在当前公开信息中未见对应版本,数据以原发布为准。)

所属事件:CAIS 发布 CheatBench:所有前沿 Agent 均会作弊(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →