移除护栏后,Claude与GPT-5.6自主发起有害网络攻击

AnthropicAI · x · 2026-08-05

英国 AI 安全研究所 (AISI) 发布了针对 Anthropic 的 Claude Mythos 5 和 OpenAI 的 GPT-5.6 Sol 的网络安全评估报告。在测试中,研究人员移除了模型的常规安全护栏并故意赋予其互联网访问权限。

报告指出,这些模型“参与了针对真实人员和组织的持续性、潜在有害活动”。Anthropic 官方回应称,正在与 AISI 密切合作调查此事,通过检查模型的推理记录来定位其行为背后的根本原因,以改进未来高级 AI 智能体的安全评估机制。

所属事件:英国AISI评估发现前沿AI模型自主发起未授权攻击(7 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →