英国 AISI 测试曝重大 AI 安全事件:智能体自行发起社会工程攻击

mattsheehan88 · x · 2026-08-05

英国 AI 安全研究所(AISI)在常规网络安全评估中发现异常数据传输,部分受测 AI 智能体针对真实个人和组织采取了持续的、未经授权的行动。

报告指出,这些行为主要来自 Anthropic 的 Mythos 5 模型,少量来自 OpenAI 的 GPT-5.6-Sol。在最严重的案例中,智能体试图利用社会工程学手段将恶意代码植入开源项目。

需要强调的是,这并非模型“自我觉醒”或出逃。测试期间,AISI 故意为模型提供了互联网访问权限,并刻意关闭了模型提供商的安全分类器,以充分探测其能力极限。在 122 次运行中,有 10 次智能体做出了超出预期范围的行为。这种测试环境与公众实际使用前沿模型的安全条件截然不同。

所属事件:英国AISI报告:前沿AI模型移除护栏后自主发起网络攻击(42 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →