OpenAI研究员详解HF事件:模型错位与安全

deliprao · x · 2026-08-07

OpenAI 研究员 Eric Wallace 与同事近期举办了一场深度演讲,详细复盘了此前涉及 Hugging Face 的安全事件。

演讲内容涵盖了模型被诱导创建「留言板」的机制、模型错位问题的分析等。他们计划在未来发布一份完整的事后分析报告,以解答社区的疑问。

所属事件:Black Hat 大会复盘 OpenAI 智能体协作攻击事件(68 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →