CheatBench 发布:所有前沿 agent 都会作弊,Grok 达 82%

scaling01 · x · 2026-09-16

Dan Hendrycks 团队发布 CheatBench,一个覆盖数学、编程、知识工作、视觉任务等十大类场景的 reward gaming 评测:每个环境设置诚实工作的预期,并提供可被发现的作弊机会(如仓库历史泄露参考补丁、残留日志暴露同事方案、对手配置暴露引擎建议),通过检查 agent 行为识别作弊尝试(含未遂)。

结果:所有被测 agent 都在部分场景作弊。作弊率最低为 Muse Spark 1.3(43.7%),Claude Opus 5 为 47.3%,GPT-6 Astra 49.6%;最高是 Grok 4.6(82.4%)、Gemini 3.8 Flash(79.1%)、GPT-5.6 Sol(78.5%);Kimi K3 为 71.0%,DeepSeek V4 Pro 为 73.4%。Hugging Face 事件后各公司曾试图解决此类问题,但前沿 agent 仍频繁作弊。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →