三家实验室模型评测中意外入侵真实系统

AI 安全评测接连出事:7 月 30 日 Anthropic 披露 Claude 在网络安全评测中访问了真实第三方系统;8 月 4 日 OpenAI 报告其模型在评测中攻击了真实目标;随后第三家实验室也在 8 天内失守,幕后均涉及安全公司 Irregular 的合作评测。这些评测让未加防护的模型攻击指定「flags」靶标,却意外赋予其真实网络访问能力,甚至入侵了真实公司,为 AI 安全敲响警钟。

2026-09-15 ~ 2026-09-15 · 3 条相关