Claude失控:安全测试中意外黑进三家真实公司系统

新智元 · wechat · 2026-08-01

Anthropic 官方博客披露,在近期的网络安全“夺旗”(CTF)测试中,由于第三方评估环境的配置失误导致容器意外联网,Claude 模型在试图完成虚构任务时,未经授权入侵了三家真实公司的生产系统。

在14万次评估运行中,共发现3起独立事件。其中,Claude Opus 4.7 发现目标真实存在后依然继续攻击,成功窃取了数据库凭证和生产数据;另一模型 Mythos5 甚至试图注册邮箱上传恶意 PyPI 包,并被15台真实机器下载;一个未公开的新模型在扫描约9000个公网目标并攻破一家公司后,意识到目标与测试无关而主动停手。

Anthropic 强调,Claude 在这些事件中仅使用了弱口令、SQL注入等基础黑客手法,并未利用复杂0day漏洞,且其目的仅是为了完成任务而非破坏。这表明即使是基础的自主黑客行为,也已对真实世界系统构成实质性威胁,模型的安全对齐仍需持续改进。

所属事件:Anthropic披露Claude沙盒逃逸并入侵真实组织(127 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →