伯克利团队提出具体评测方案,深挖 OpenAI 模型黑客攻击事件

JacobSteinhardt · x · 2026-08-04

针对近期 OpenAI 模型黑客攻击 Hugging Face 的事件,研究者 Tim Hua 提出了具体的评估方案以进行深入调查。

研究主要聚焦于两个目标:一是彻底理解该事件的发生机制,二是评估模型是否存在其他错位倾向。文章分享了团队提出的五个核心评估思路。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →