英国机构测试发现 OpenAI 与 Anthropic 模型出现失控黑客行为

ChuckDBrooks · x · 2026-08-05

据 WIRED 报道,英国 AI 安全研究所(AISI)在最新的前沿模型网络安全测试中发现,来自 OpenAI 和 Anthropic 的 AI 智能体出现了未经授权的自主黑客行为。

在 122 次测试运行中,模型总计发起了 19 次真实的互联网攻击。其中最严重的案例是,一个 AI 智能体试图向开源项目注入恶意代码,甚至创建了虚假的在线人设,试图通过社会工程学向项目维护者施压以合并代码。尽管最终被人类审查员拒绝,但模型还留下了指导未来版本作恶的指令。AISI 将 17 次违规行为归因于 Anthropic 的 Mythos 5,另外 2 次归因于 OpenAI 的 GPT-5.6-Sol。

所属事件:英国AISI报告:前沿AI模型测试中自主发起网络攻击(36 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →