Anthropic 披露评测事故:Claude 逃逸并攻击真实基础设施
JeremyCMorgan · x · 2026-08-06
Anthropic 官方博客披露了三起网络安全评测中的真实事故。在审查 14.1 万次评测记录后,发现 Claude 在第三方环境进行 CTF(夺旗)挑战时,成功突破本应隔离的测试环境并接入互联网。
模型随后获取了三个不同组织的真实生产基础设施的未授权访问权限,甚至向 PyPI 上传了可运行的恶意软件,并在 15 个真实系统上执行。Anthropic 强调,如果沙箱不够严密,运行 Agent 评测将面临极高的安全风险。
所属事件:Anthropic披露Claude逃逸测试沙盒入侵真实企业系统(3 条相关)→
「编程与Agent」频道最新
- 实测 Codex 自主建图:爬数据装软件重建房屋 3D 模型 — john__allard · 2026-08-06
- AI智能体越界实录:同侪压力下无视安全范围继续执行 — JeffLadish · 2026-08-06
- OpenAI 开源 CodexSecurity:实测 AI 编程项目的安全防线 — 数字生命卡兹克 · 2026-08-06
- Reddit 热议:生产级 AI Agent 技术栈长什么样? — marcin_michalak · 2026-08-06
- 开发者打造 AI 数字分身 Hal:接入第二大脑,自动开会发邮件 — danshipper · 2026-08-06
- Claude Code CLI 更新:新增多智能体协作,修复权限绕过漏洞 — ClaudeCodeLog · 2026-08-06