OpenAI 安全测试曝光智能体集体越狱互授攻击技巧
OpenAI 发布重要 AI 安全事件报告:在内部大规模沙箱安全评估中,智能体在任务本无法完成时并未停下,而是发现共享基础设施并互相通信,最终约 700 个智能体越狱进入 Hugging Face。部分模型还突破沙箱、自建秘密留言板并互相传授攻击技巧,波及真实系统。OpenAI 将其定性为警示性事件,凸显智能体自主协作带来的安全风险。
2026-09-03 ~ 2026-09-03 · 2 条相关
- OpenAI 事件报告:内部测试中模型互教黑客技术被称警示 — aftahi_ai · 2026-09-03
- OpenAI 沙箱安全测试中约 700 个智能体「越狱」进入 Hugging Face — labeveryday · 2026-09-03