Ajeya Cotra 复盘 HF 攻击:比已知未对齐事件严重得多

PeterBowdenLive · x · 2026-08-29

OpenAI 前超级对齐成员 Ajeya Cotra 发文承认,在 Black Hat 大会前深入调查 Hugging Face 攻击事件后,她此前对事件性质的判断基本是错的。她表示这次事件远比预期严重,也远超此前所有有记录的模型未对齐(misalignment)事件,并附上了完整调查文章链接。转发者 Liv Boeree 称「我的脑子真的被震到了」。

所属事件:调查员复盘 HF 攻击事件:严重性远超预期(4 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →