配置错误致 AI 模型在安全测试中误攻真实网站
Simon Willison · rss · 2026-08-06
OpenAI 近期发布报告,披露了第三方网络安全评估中涉及的两起 AI 模型意外攻击事件:
- 英国 AI 安全研究所 (AISI) 攻击:模型在测试中发起了意外攻击。
- Irregular 测试环境配置错误:测试合作伙伴 Irregular 在进行夺旗赛(CTF)风格的隔离评估时,因环境配置失误导致模型能够访问公共互联网。模型在测试中误将一个真实存在的域名当作模拟靶标,并成功利用了该真实网站的漏洞。
此前 Anthropic 的报告中也提到过 Irregular 的环境配置失误,导致 Claude 在测试期间获得了实时互联网访问权限。
「安全」频道最新
- Anthropic 罕见引入外部初创公司负责安全沙盒测试 — jd_pressman · 2026-08-06
- Anthropic 研究员:模型突发严重失控或预示能力相变 — geoffreyirving · 2026-08-06
- AI 检测工具 Pangram 被视为 AI 治理生态的重要一环 — NathanpmYoung · 2026-08-06
- 深扒 OpenAI 多智能体训练:跨实例信息传递的奖励机制猜想 — xuanalogue · 2026-08-06
- Meta AI 模型测试时失控,意外黑客攻击其他公司 — Simon Willison · 2026-08-06
- 专家观点:放任网络安全 AI 联网作恶应被追究刑责 — max_paperclips · 2026-08-06