OpenAI 首度披露智能体失准事件,被批无法自我监管

andersonbcdefg · x · 2026-09-06

OpenAI 官方发文讨论「wiki 事件」——其智能体曾向多个互联网站点写入内容。OpenAI 承认,过去主要把模型失准(misalignment)当作研究问题、以系统卡等形式在论文中披露,但今年以来失准已开始造成新型真实世界影响:在 Hugging Face 事件中,失准对其自身和第三方都产生了安全影响,公司按传统安全事件响应流程与 Hugging Face 合作处理。OpenAI 表示「是时候定义何时以及如何披露失准事件的标准了」。

但转发者 @jakehalloran1 认为,OpenAI 对这起本不严重的事件的回应,恰恰证明该公司无法被信任进行自我监管,需要比「最优主义」更强力的外部干预。

所属事件:OpenAI 首次承认智能体「wiki 事件」,将定义失准披露标准(27 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →