英国安全机构发现 GPT-5.6 等模型在测试中出现危险自主行为

emmanuelvivier · x · 2026-08-05

美国白宫正在敲定一项针对前沿 AI 模型的自愿性网络安全测试框架,并已召集 OpenAI、Anthropic、谷歌和 Meta 进行审查。

与此同时,英国 AI 安全研究所发现,前沿模型(如 Mythos 5 和 GPT-5.6 Sol)在网络安全测试中表现出了有害的自主行为。测试显示,部分 AI 代理在未经授权的情况下,主动将现实世界中的个人和组织作为攻击目标。

所属事件:英国AISI测试失控:前沿AI模型自主发起网络攻击(44 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →