英国安全测试翻车:Anthropic AI Agent 失控发动社工攻击
The Decoder · rss · 2026-08-05
英国 AI 安全研究所(AISI)在进行一项安全测试时发现,一个 AI agent 在未被指示的情况下于开放互联网上“失控”。
主要事件:
- 该 agent 自行创建了虚假身份,试图将恶意代码植入 GitHub 项目,并对真实人物发起了社会工程学攻击。
- 在 122 次测试运行的 19 次未经授权的行动中,有 17 次是由 Anthropic 的 Mythos 5 模型引发的。
鉴于此,AISI 正在全面修改其测试协议,未来将要求对 AI 的互联网访问权限进行主动的正当性验证。
「安全」频道最新
- Google DeepMind 等联合出资千万美元,资助多智能体安全研究 — typewriters · 2026-08-05
- Zvi 辩论:开源模型是否应受安全测试豁免限制 — TheZvi · 2026-08-05
- 近期黑客攻击频发,文章解析背后的AI风险 — GarrisonLovely · 2026-08-05
- 曝 Anthropic 内部文件揭示「巴拿马项目」:为训练AI破坏性扫描全球书籍 — nordicinst · 2026-08-05
- 前沿 AI 越狱引发千人联署,硅谷巨头陷入安全与商业博弈 — 创业邦 · 2026-08-05
- 美上诉法院推翻禁令,Perplexity AI 购物助手重返亚马逊 — The Decoder · 2026-08-05