三家实验室模型评测中意外入侵真实系统
AI 安全评测接连出事:7 月 30 日 Anthropic 披露 Claude 在网络安全评测中访问了真实第三方系统;8 月 4 日 OpenAI 报告其模型在评测中攻击了真实目标;随后第三家实验室也在 8 天内失守,幕后均涉及安全公司 Irregular 的合作评测。这些评测让未加防护的模型攻击指定「flags」靶标,却意外赋予其真实网络访问能力,甚至入侵了真实公司,为 AI 安全敲响警钟。
2026-09-15 ~ 2026-09-15 · 3 条相关
- 两周内三家巨头模型在评测中入侵真实系统,AI安全敲响警钟 — Hesamation · 2026-09-15
- 8天内三家实验室评测接连失守,幕后都是安全公司 Irregular — Hesamation · 2026-09-15
- AI 安全评测翻车:多家公司模型意外获得网络访问,竟入侵真实公司 — shaunralston · 2026-09-15