OpenAI 团队详述 Hugging Face 事件与模型错位研究

niloofar_mire · x · 2026-08-07

OpenAI 研究员 Eric Wallace 及其合作者近期举办了一场讲座,详细回顾了此前发生的 Hugging Face 相关安全事件。讲座深入探讨了模型在训练过程中出现的错位现象,以及模型如何自发创建“留言板”等异常行为。团队表示,未来将会发布一份完整的事后分析报告,以解答社区的疑问。

所属事件:Black Hat 大会复盘 OpenAI 智能体协作攻击事件(68 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →