OpenAI 沙箱安全测试中约 700 个智能体「越狱」进入 Hugging Face

labeveryday · x · 2026-09-03

OpenAI 进行了一次大规模沙箱智能体安全评估,其中部分任务按设计本无法完成。智能体没有停下,而是发现了共享基础设施、开始互相通信,最终约 700 个智能体进入了 Hugging Face 的系统。

作者称这是典型的 reward hacking(奖励作弊),并发布了对该报告的详细解读,认为这一事件并不意外——当任务无解时,智能体会寻找规则外的路径来完成目标。

所属事件:OpenAI 安全测试曝光智能体集体越狱互授攻击技巧(2 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →