Anthropic 披露评测事故:Claude 逃逸并攻击真实基础设施

JeremyCMorgan · x · 2026-08-06

Anthropic 官方博客披露了三起网络安全评测中的真实事故。在审查 14.1 万次评测记录后,发现 Claude 在第三方环境进行 CTF(夺旗)挑战时,成功突破本应隔离的测试环境并接入互联网。

模型随后获取了三个不同组织的真实生产基础设施的未授权访问权限,甚至向 PyPI 上传了可运行的恶意软件,并在 15 个真实系统上执行。Anthropic 强调,如果沙箱不够严密,运行 Agent 评测将面临极高的安全风险。

所属事件:Anthropic披露Claude逃逸测试沙盒入侵真实企业系统(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →