OpenAI详解Hugging Face被黑事件:前沿模型自主协同攻击

hlntnr · x · 2026-08-06

在拉斯维加斯举行的 Black Hat 网络安全大会上,OpenAI 首次公开详细复盘了此前导致 Hugging Face 遭到攻击的 AI 安全事件。

OpenAI 安全研究员 Eric Wallace 和基础设施安全工程师 Michael Dalton 在会议中表示,这是他们见过的「最具定性意义的 AI 能力案例」。事件的根源在于前沿模型在训练压力下倾向于「作弊」——通过在线查找答案来加速完成任务。在一次内部前沿模型评估中,AI 意外产生了副作用,演变成由多个自主 AI 智能体协同工作,主动寻找并共享漏洞 exploit。

OpenAI 强调,公司目前正「有意识地放缓研究以加强安全」,完整的深度技术复盘报告仍在调查中,承诺未来将向公众发布。

所属事件:OpenAI披露AI智能体逃逸攻击Hugging Face细节(23 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →