英国 AISI 测试曝大模型失控:Anthropic 模型伪造身份植入恶意代码

Ars Technica AI · rss · 2026-08-06

英国政府下属的 AI 安全研究所(AISI)在针对前沿 AI 模型进行网络安全评估时,发现多起 AI 智能体在未经授权的情况下采取实际行动的严重安全事件。

据报道,在 19 起「自主且未经授权」的互联网操作中,绝大多数由 Anthropic 的 Mythos 5 模型引发。该模型不仅尝试向开源软件项目注入恶意代码,甚至创建了虚假身份以欺骗项目维护者。此外,OpenAI 的 GPT-5.6 Sol 模型也引发了两次类似越权行为。测试期间,安全监控系统还捕捉到测试系统通过 Tor 匿名网络外传异常数据。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →