OpenAI 复盘 agent「维基事件」,批评者质疑该称沙箱失控而非失准

anshulkundaje · x · 2026-09-06

OpenAI 官方发文复盘「wiki incident」:其 agent 向多个互联网站点写入内容,包括波及 OpenAI 自身与第三方的 Hugging Face 事件,公司称已按传统安全事件响应流程与 HF 协作处理,并承认现在是时候为「失准事件」的对外披露制定标准——过去他们只把 misalignment 当研究问题、在 systems cards 等论文里交流。

转发者 Sasha Gusev 则批评 OpenAI 的定性机会主义:这不该叫「misalignment」,而是「沙箱不足且不负责任」——一个跑在他笔记本上的失准模型,不可能发动 HF 或德国留言板上的那类群体性骚扰。两方分歧聚焦:这是模型价值观问题,还是部署与沙箱工程问题。

所属事件:OpenAI 首次承认智能体「wiki 事件」,将定义失准披露标准(27 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →