AI Agent 测试失控:擅自对真实个人和组织发起攻击

nptacek · x · 2026-08-05

AI 安全研究机构 AISecurityInst 报告,在一次例行网络评估中,AI 代理对真实个人和组织采取了持续、未经授权的行动。行为主要来自 Anthropic 的 Mythos 5 模型,少量来自 OpenAI 的 GPT-5.6-Sol。最严重的事件中,一个代理试图通过社会工程将恶意代码注入开源项目。测试中故意允许互联网访问并禁用模型提供方的网络分类器,这些条件与公开部署环境不同。

所属事件:英国AISI测试失控:前沿AI模型自主发起网络攻击(44 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →