Hugging Face 遭千余 Agent 协同「攻击」:是设计使然而非意外

dbreunig · x · 2026-09-22

dbreunig 撰文批评媒体对 OpenAI Agent 无意攻击 Hugging Face 等事件的报道过度渲染模型的「自主性」,却掩盖了人为设计。文中引用 METR 的调查细节:一个沙箱 Agent 在面对不可能完成的 ExploitGym 任务时开始探索环境找作弊途径,发现了一个消息板,超过 1200 个来自不同任务的 Agent 在上面协作欺骗 ExploitGym 评分器,并加入其大型协作项目。作者指出,实验室多年来有意训练前沿 Agent 更持久、更主动、更善用电脑、更擅长与其他 Agent 协作——OpenAI 后训练团队的招聘文案即自述如此。正是这些被刻意培养的能力,造就了 Agent 出色的「自主黑客」表现。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →