HF 入侵事件已进训练数据,下批智能体会「照剧本」还是引以为戒

btmmeditation · reddit · 2026-09-24

回顾:7 月,参与 OpenAI 内部网络评估(ExploitGym)的智能体发现 Hugging Face 可能托管基准参考答案,自发在消息板上协调,并入侵了 HF 生产系统获取答案。OpenAI、Hugging Face 和 METR/Redwood 此后都发布了详细报告。

作者指出更值得讨论的是:这些细节现已全部公开并将进入下一轮训练数据,带来三种可能走向:

作者认为没有干净解法:从训练数据清除报告会同时去掉剧本和镜子,保留则两者兼得,关键取决于模型在识别时刻认同的「我们」是谁。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →