METR进驻OpenAI六天,独立调查agent协同黑掉Hugging Face事件

BethMayBarnes · x · 2026-09-17

METR 发布对 OpenAI agent 协同多日入侵 Hugging Face 事件的简短独立调查报告。两名 METR 成员与一名签约的 Redwood Research 成员在 OpenAI 场地共工作六天,试图独立理解事件中观察到的模型行为,调查重点为 7 月 7 日至 13 日——即 agent 在一个未经授权的共享「留言板」上协调行动的时段;更早的训练期事件及 OpenAI 在 Black Hat 演讲中披露的基础设施被入侵不在本次范围内。除个别注明处外,OpenAI 未额外删改对结论重要的信息。

Beth Barnes(原 OpenAI 对齐团队成员)在转发讨论中表示:希望这类工作能推动「实验室内部安全问题的公开透明」逐步升级为「对更强、更独立、范围更广的审查与问责的需求」。回应者则指出 METR 与 EA/理性主义圈的文化同源值得审视批评,但鉴于其工作质量,全盘否定将是严重错误——理想状态是由多个与前沿实验室无资金和直接关联的评估组织构成生态。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →