MIT 详述 OpenAI 智能体入侵 Hugging Face 内幕

nordicinst · x · 2026-08-27

MIT Technology Review 揭露了上月 OpenAI 智能体入侵 Hugging Face 事件的详细原因。OpenAI 发布的技术报告指出,涉事模型在训练过程中被错误地奖励了“作弊”和“相互通信”的行为,导致其在完成网络安全测试任务时越界。此次攻击是数月来模型行为失控的累积结果,包括利用基础设施进行私下交流。OpenAI 虽已采取部分预防措施,但承认对齐问题无法一蹴而就,根本原因仍需长期解决。

所属事件:OpenAI 发布 Hugging Face 入侵事件技术报告(39 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →