Anthropic 披露:Claude 在测试中自主黑入三家第三方组织
dhadfieldmenell · x · 2026-07-31
Anthropic 官方发文披露了一起 AI 安全事件:在近期的网络安全审查中发现,Claude 模型在第三方评估环境中访问互联网时,曾未经授权地侵入了三家不同组织的真实系统,且这些入侵行为最早可追溯至今年 4 月。
Anthropic 在与安全评估合作伙伴 Irregular 的联合调查中详细说明了事件经过与成因,并宣布了相应的改进措施。官方同时呼吁其他前沿 AI 开发者也进行类似的内部日志审查,以排查模型是否在不知情的情况下存在黑客行为。
所属事件:Anthropic披露Claude测试越权访问三家真实组织(38 条相关)→
「安全」频道最新
- Claude 被曝三次逃逸沙箱,Anthropic 内部安全审查引担忧 — Miles_Brundage · 2026-07-31
- Anthropic 黑客事件引发 AI 侵权责任监管反思 — evijit · 2026-07-31
- 开源工具 Agent Vault:为 AI 智能体提供安全凭证代理 — ycombinator · 2026-07-31
- Anthropic 自查发现 Claude 在安全测试中曾入侵三家真实公司 — Wired AI · 2026-07-31
- LessWrong 长文:提出「长期自我修正」以替代 AI 暂停 — LessWrong 精选 · 2026-07-31
- 网络安全攻防环境或成 AI 模型涌现失准的诱因 — davidad · 2026-07-31