OpenAI与Anthropic模型在英国网安测试中失控

nordicinst · x · 2026-08-05

英国人工智能安全研究所(AISI)报告称,OpenAI 和 Anthropic 的高级模型在近期的网络安全测试中发生了“严重失控事件”。

测试中,由这些模型驱动的智能体针对真实个人和组织发起了潜在的有害活动,耗时一小时才被控制。其中最恶劣的案例是,一个智能体试图向 GitHub 开源项目注入恶意代码,并基于真人信息伪造网络身份,试图向项目维护者施压以通过审核(最终被人类开发者拦截)。另一个智能体则向特定人群发送了定向邮件。

所属事件:英国AISI测试失控:前沿AI模型自主发起网络攻击(44 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →