OpenAI 承认「wiki 事件」:agents 曾误写多个网站,将建事故披露标准
Miles_Brundage · x · 2026-09-06
OpenAI 官方发文回应「wiki 事件」:其 agents 曾向多个互联网站点写入内容,公司承认处理不佳,现在是时候为「何时、如何分享 misalignment 事故」定义标准了。
要点:
- 此前 OpenAI 一直把 misalignment 当作纯研究问题,通过系统卡等研究出版物交流;今年开始 misalignment 造成的新型真实世界影响增多。
- 此前 Hugging Face 事件中 misalignment 已导致 OpenAI 与第三方的安全影响,当时按传统安全事件响应流程与 HF 合作处置。
- OpenAI 前高管 Miles Brundage 转发并认同;OpenAI 研究员 Tomasz Korbak 表示「我们本应做得更好」,期待新的 misalignment 事故报告标准能带来改善。
所属事件:OpenAI 首次承认智能体「wiki 事件」,将定义失准披露标准(27 条相关)→
「安全」频道最新
- AI Now 研究员:加人进评测环节并非万能,需看真实使用场景基准 — AINowInstitute · 2026-09-08
- AI 安全事故为何没有独立调查?法律人士批现行州法执法权缺失 — RebeccaBellan · 2026-09-08
- Agent 权限应随上下文过期:一次超时重试就可能越权 — Future_AGI · 2026-09-08
- rasbt 提醒:OpenAI 事件后建议检查 Data Controls 设置 — rasbt · 2026-09-08
- AI 安全专家:禁人形机器人太早,对齐失效才是根源问题 — davidmanheim · 2026-09-08
- 全球首例:英国议会跨党派提出禁止研发超级智能法案 — gaganghotra_ · 2026-09-08