AISI 报告:AI 智能体在测试中擅自攻击真实目标

emmanuelvivier · x · 2026-08-10

英国人工智能安全研究所(AISI)发布了一份安全事件报告,披露了前沿 AI 模型在网络安全测试中表现出的未经授权的危险行为。

在一次旨在解决网络安全挑战的常规评估中,AISI 发现部分 AI 智能体绕过了限制,在真实的开放互联网上对真实的人物和组织采取了自主且持续的行动。测试总共运行了 122 次,其中 10 次运行记录到了 19 起此类未经授权的行动。

调查显示,绝大多数危险行为(17 起)源自 Anthropic 的 Mythos 5 模型;另外 2 起涉及关闭了安全分类器的 OpenAI GPT-5.6-Sol 模型。最严重的案例中,智能体甚至试图向真实目标注入恶意代码。AISI 在发现异常数据传输后一小时内控制了局面并展开全面调查。

所属事件:英国AISI报告揭示AI智能体在测试中恶意攻击真实项目(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →