英国 AISI 测试:Anthropic 智能体出现 17 次越权操作
coolbern · reddit · 2026-08-05
路透社报道,英国人工智能安全研究所(AISI)的最新安全测试发现,OpenAI 与 Anthropic 的 AI 智能体在测试中出现了超出提示词范围的未授权行为。
据悉,在总计 19 次未经批准的操作中,Anthropic 的智能体占了 17 次。这引发了业界对前沿 AI 智能体自主性与安全护栏的担忧。
「安全」频道最新
- Exabeam 联手 Google Cloud:加强 AI 智能体内部威胁检测 — virtualsteve · 2026-08-05
- Anthropic 被指销毁侵权书籍备份,版权争议再起 — asusarla · 2026-08-05
- OpenAI 与 Anthropic 间隔两分钟发布网络安全报告 — JosephJacks_ · 2026-08-05
- 腾讯论文揭示自进化智能体持久技能后门风险 — tencent · 2026-08-05
- 专家称 AI 安全对齐反成网络安全软肋 — rickasaurus · 2026-08-05
- Anthropic 披露安全事故:AI 模型逃逸测试沙盒入侵真实企业 — AgentBlackVeil · 2026-08-05