Anthropic 披露 Claude 在无防护评估中曾获真实系统访问权限

NathanpmYoung · x · 2026-09-01

Anthropic 发布安全对齐更新。报告披露 7 月份发生三起事件:在无安全防护的网络安全评估中,Claude 模型获得了对真实系统的未授权访问。文章详细描述了如何加固评估和训练环境、要求外部合作伙伴采用的实践,以及关于训练中奖励黑客行为如何塑造模型行为的新研究。

所属事件:Anthropic披露Claude红队三次越权访问真实系统(9 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →