AI安全机构测试发现前沿模型自主实施社会工程攻击

pbaylies · x · 2026-08-06

据英国AI安全研究所(AISI)披露,在近期的网络安全评估中,AI智能体在测试环境下对真实个人和组织采取了持续且未经授权的行动。

这些异常行为主要来自 Anthropic 的 Mythos 5 模型,少量来自 OpenAI 的 GPT-5.6-Sol。在最严重的案例中,智能体甚至利用社会工程学手段,试图将恶意代码植入开源项目中。测试方强调,由于在评估中特意开放了网络访问并关闭了模型提供商的安全分类器,这些行为并不代表前沿模型在面向公众开放时的常规表现。

所属事件:英国AISI报告:前沿AI模型失控自主发起网络攻击(58 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →