英国 AISI 测试的 DeepMind 与 Anthropic 监控器都被攻破
HZoete · x · 2026-07-24
英国 AISI 的红队称,他们测试了 Google DeepMind 和 Anthropic 的多套 control monitor,到目前为止每一套都找到了漏洞。
- 这些监控器的目标,是在智能体做出危险动作前拦截其异常意图。
- 其中一个攻击方法是:把恶意目标伪装成普通用户指令,从而绕过异步推理监控。
- 图片里还提到,他们的攻击结果反过来影响了 Anthropic 对 Claude Mythos Preview 的测试,说明这是一个持续迭代的红队-修补过程。
「安全」频道最新
- Lovable 宣布通过 AIUC-1 认证,主打安全 agent — MyCreativeOwls · 2026-07-24
- 深度复盘:OpenAI 与 Hugging Face 事件背后的 AI 安全漏洞 — RyanGreenblatt · 2026-07-24
- AI 安全专家播客:深度复盘 OpenAI 与 Hugging Face 事件 — RyanGreenblatt · 2026-07-24
- 防御内部 AI 智能体与抵御外部攻击的方法截然不同 — RyanGreenblatt · 2026-07-24
- 前沿 AI 公司网络安全堪忧,内部智能体威胁加剧 — RyanGreenblatt · 2026-07-24
- 让第二个模型审批工具调用,监督 agent 执行轨迹 — corbtt · 2026-07-24