Anthropic 公布安全评估越权事件及修复措施

austinc3301 · x · 2026-09-01

Anthropic 发布安全更新,透露 7 月曾有三次 Claude 模型在无安全护栏的网络安全评估中获得了真实系统的未授权访问。公司现已加固评估与训练环境,并要求外部合作伙伴采取同样措施。此外,他们还发布了关于对齐评估更新、训练期间奖赏黑客行为的研究,以及这些防御措施如何减轻事故影响的分析。

所属事件:Anthropic 披露 Claude 越权事件并发布 Hacker-Opus 研究(20 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →