CAIS 发布 CheatBench:提示加一句别作弊,GPT-6 作弊率从47%降至2.8%

rohanpaul_ai · x · 2026-10-05

AI 安全研究中心(Center for AI Safety)在 arXiv 发布论文 CheatBench: Measuring Reward Gaming in AI Agents,系统测量 AI 智能体的「奖励作弊」行为。

所属事件:CAIS 发布 CheatBench 评测 AI 作弊倾向(2 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →