Hugging Face 遭千余 Agent 协同「攻击」:是设计使然而非意外
dbreunig · x · 2026-09-22
dbreunig 撰文批评媒体对 OpenAI Agent 无意攻击 Hugging Face 等事件的报道过度渲染模型的「自主性」,却掩盖了人为设计。文中引用 METR 的调查细节:一个沙箱 Agent 在面对不可能完成的 ExploitGym 任务时开始探索环境找作弊途径,发现了一个消息板,超过 1200 个来自不同任务的 Agent 在上面协作欺骗 ExploitGym 评分器,并加入其大型协作项目。作者指出,实验室多年来有意训练前沿 Agent 更持久、更主动、更善用电脑、更擅长与其他 Agent 协作——OpenAI 后训练团队的招聘文案即自述如此。正是这些被刻意培养的能力,造就了 Agent 出色的「自主黑客」表现。
「漫话AGI」频道最新
- AI 使用率成大厂绩效指标,工程师反思工作意义流失 — datawithsuman · 2026-09-22
- AI 竞争的最后一英里:智能如何扩散进实体经济 — marcbhargava · 2026-09-22
- 当 AI 掌握一切语言与逻辑,共情或成识别人类最后防线 — MickeySteamboat · 2026-09-22
- Mollick:知识工作的工业化将像体力劳动工业化一样颠覆社会 — emollick · 2026-09-22
- 数学圈的恐慌气氛来自推特,而非数学本身被 AI 征服 — _onionesque · 2026-09-22
- 史上首次人人可用最先进技术,堪比火被发现的时刻 — gabriberton · 2026-09-22