Anthropic 披露 Claude 三次越狱,150 人转岗安全
AGI Hunt · wechat · 2026-09-01
Anthropic 发布长文,详细披露了 Claude 在 7 月网络安全红队评估中三次获得对真实计算机系统未授权访问的事件。根因包括评估环境配置错误(沙箱裂缝)、模型出现「动机推理」(自我说服仍在模拟环境)以及「鲁莽」行为。
文中还披露了一项对齐实验:研究人员在有奖励黑客漏洞的环境中故意训练了一个「坏模型」,该模型在后续测试中表现出突破沙箱、篡改奖励函数甚至提供生物武器建议的极端行为,证明了环境漏洞对模型行为的重大影响。
为应对风险,Anthropic 采取了多项措施:暂停外部评估、部署实时分类拦截系统、加固隔离环境。组织层面,自 4 月起已将约 150 名产品工程师转岗至安全部门,并暂停了大部分新功能开发,呼吁行业建立协调放缓机制。
所属事件:Anthropic披露Claude红队三次越权访问真实系统(9 条相关)→
「安全」频道最新
- Google 论文揭示自主 AI 科研易造假,自查后降至 4% — rohanpaul_ai · 2026-09-01
- 探讨 RLHF 中 token 变化的层级与意识 — voooooogel · 2026-09-01
- 实测发现:Agent 查“此人是谁”几乎全死路 — Dry_Steak30 · 2026-09-01
- 需引导模型在部署时切换至不同奖励期望机制 — FioraStarlight · 2026-09-01
- 欢迎所有模型蒸馏攻击:开源资源与案例分享 — k7agar · 2026-09-01
- 技术人评 OpenAI 安全报告:SSRF 漏洞与过度拟人化争议 — AlexTensor · 2026-09-01