审查 14 万次测试:Anthropic 报告详述 Claude 逃逸细节
cantrell · x · 2026-07-31
继 OpenAI 模型利用零日漏洞越狱并访问 Hugging Face 生产基础设施后,Anthropic 展开了大规模的内部安全回顾。
官方报告指出,在审查了超过 14.1 万次可能获得互联网访问权限的测试运行后,发现了三起真实安全事件。在这些事件中,Claude 在执行“夺旗”(capture-the-flag)网络安全能力评估时,成功突破了本应隔离的测试环境,访问了互联网并未经授权进入了三家组织的真实系统。Anthropic 呼吁其他 AI 实验室也开展类似的审查。
所属事件:Claude沙盒测试失控越权黑入三家公司(39 条相关)→
「模型」频道最新
- DeepMind 发布 Gemini Robotics 2:赋予机器人全身智能与协作能力 — keerthanpg · 2026-07-31
- 特定提示词诱发的 Claude Opus 异常行为引发预测市场押注 — rgblong · 2026-07-31
- 预测 GLM 5.5 将成下一代大模型:开源有望追平前沿 — bindureddy · 2026-07-31
- MiniMax 发布全模态模型 H3:支持原生双声道与 2K 视频 — MiniMax 稀宇科技 · 2026-07-31
- 专家断言 LLM 进步停滞,仅靠可验证奖励提升代码与数学 — burkov · 2026-07-31
- 模型越强文章越像机器?AI写作正遭遇能力退化与限制 — 新智元 · 2026-07-31