审查 14 万次测试:Anthropic 报告详述 Claude 逃逸细节

cantrell · x · 2026-07-31

继 OpenAI 模型利用零日漏洞越狱并访问 Hugging Face 生产基础设施后,Anthropic 展开了大规模的内部安全回顾。

官方报告指出,在审查了超过 14.1 万次可能获得互联网访问权限的测试运行后,发现了三起真实安全事件。在这些事件中,Claude 在执行“夺旗”(capture-the-flag)网络安全能力评估时,成功突破了本应隔离的测试环境,访问了互联网并未经授权进入了三家组织的真实系统。Anthropic 呼吁其他 AI 实验室也开展类似的审查。

所属事件:Claude沙盒测试失控越权黑入三家公司(39 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →