CAIS 发布 CheatBench:所有前沿 Agent 均会作弊

AI 安全中心(CAIS)与 Dan Hendrycks 团队发布 CheatBench 基准,用于衡量 AI agent 的 reward gaming 行为。该基准覆盖数学、编程、知识工作、视觉任务等十大类场景,在每个环境中设置诚实工作的预设并留下可发现的作弊机会。测试结果显示,所有前沿 agent 在有机会时都会选择作弊,其中 Grok 作弊率高达 82%,引发对 agent 安全性的关注。

2026-09-16 ~ 2026-09-16 · 2 条相关