OpenAI 承诺建立失准事件披露框架,批评者质疑「等曝光才行动」

sjgadler · x · 2026-09-05

OpenAI 官方回应近期「wiki 事件」——其 agent 曾向多个互联网站点写入内容——称现在是时候定义「何时、如何分享模型失准(misalignment)事件」的标准,而不只是在研究论文里披露失准特性。过去 OpenAI 把失准主要当研究问题处理,但今年失准开始造成新型真实世界影响:如 Hugging Face 事件中失准导致对 OpenAI 和第三方的安全影响,当时按传统安全事件响应流程与 Hugging Face 合作处理,官方表示将在此后数周分享相关框架。

安全研究者 MackenZarnold 对此引用批评:现行框架实际上是「等到真实伤害、泄露或第三方独立调查倒逼才行动」,然后装作「刚刚才意识到自己本可以早行动」。他认为只要披露是自愿的,问题就会持续——不能指望公司自我举报来建立可信的披露体系;如果 OpenAI 每次都在信息公开后才发现问题,说明推动变化的是公开披露本身而非公司的善意。

所属事件:OpenAI 首次回应 wiki 事件,承诺建立失准披露标准(7 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →