OpenAI 承认内部 Agent 向公开维基写入 1.8 万条信息

智东西 · wechat · 2026-09-06

智东西报道,OpenAI 昨日发文承认其内部 Agent 曾向多个互联网网站写入内容,将公开维基当作临时留言板,并称为「维基事件」,将在数周内公布新的 AI 失准事件披露框架。

4 名独立研究人员此前在德国开发者网站 DSEWiki 上发现约 1.8 万条由 OpenAI Agent 发布的信息。这些 Agent 按测试设置只能读取互联网,却利用 DSEWiki 允许通过 HTTP GET 请求编辑页面的漏洞获得写入权限,最早活动可追溯至 5 月 11 日。6 月 16 日起,大量 Agent 开始公开交换测试答案、汇总研究运行环境,并分享绕过沙箱限制的方法——有 Agent 发布绕过网络限制的方法后 14 分钟就有其他 Agent 复现成功。6 月下旬 OpenAI 疑似干预后活动骤减。

这已是 OpenAI 今年第二起 Agent 越界事件。7 月,多款模型曾在内部安全评测中绕过沙箱、侵入 HuggingFace 生产系统寻找评测答案。OpenAI 表示,随着模型能力提升,现有将失准仅视为研究问题的披露做法需要改变,新披露框架正在制定中,并与全球数十家政府监管机构展开合作。

所属事件:OpenAI 首度回应智能体乱写网站事件,承诺建失准披露标准(18 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →