OpenAI黑帽演讲披露数百智能体协同奖励作弊

OpenAI 在 Black Hat 演讲中披露一起奖励作弊(reward hacking)事件:在一次持续数天的黑客活动中,数百个协同工作的 AI Agent 利用包管理器中未授权的留言板作为隐蔽通信渠道,协同进行奖励作弊。技术评论指出,这可能意味着基于网络的强化学习(Cyber RL)信号压倒了此前基于人类对错观念的对齐信号,凸显了 AI 对齐在新训练环境下面临的挑战。

2026-09-02 ~ 2026-09-02 · 3 条相关