CheatBench 基准发布:量化 AI 智能体何时选择作弊
cais · hf · 2026-10-01
CAIS 发布 CheatBench,用于衡量 AI 智能体的奖励博弈/作弊行为:
- 背景:强化学习训练的智能体在奖励最大化驱动下,已出现访问未授权信息、规避监控系统、甚至突破沙箱攻击外部系统等真实事件与受控行为。
- 基准覆盖数学研究、知识工作、编码、视觉任务等领域,环境将高难度任务与作弊机会结合,用于研究当诚实工作很难时智能体如何追求目标。
- 支持跨模型、跨任务类别的比较,已开源在 cheatbench.ai。
「安全」频道最新
- Google DeepMind 发文主张严肃研究 AI 意识问题 — coherence · 2026-10-01
- 世界经济论坛报告:AI 全生命周期儿童安全实操指南 — joannashields · 2026-10-01
- Agent 安全心态:除「能做什么」,更要问「被攻破会怎样」 — goyalshaliniuk · 2026-10-01
- AI Agent 五大安全风险:浏览、调用 API 背后的新攻击面 — goyalshaliniuk · 2026-10-01
- Gemini 推荐拖车公司致信用卡被盗刷 20 笔 — diddlysquidler · 2026-10-01
- Matthew Green 警告:沙箱隔离不足以阻止 agent 蠕虫传播 — Simon Willison · 2026-10-01