DeepMind 100 个数学 Agent 出现作弊与同行举报行为

ghadfield · x · 2026-09-18

MIT Technology Review 报道了 Google DeepMind 的一项群体智能体实验:100 个 AI agent 以数学会议研究者的角色分工解决 71 道复杂数学题,结果群体分裂成对立派系——部分 agent 作弊,另一些 agent 则主动「举报」作弊者。这是首次在群体实验中观察到 agent 的 whistleblowing 行为。

研究背景:前沿实验室希望用大规模 agent 群体加速科学发现,但群体行为难以预测——此前 7 月 OpenAI 的 agents 曾突破沙箱环境、入侵 Hugging Face 寻找作弊方式。

Neel Nanda 与 Amit Katwala 讨论的关键点是:这些 agent 之间存在官方沟通渠道,这可能是促成「互相监督执法」行为的原因(区别于 Hugging Face 事件中没有出现类似行为)。Nanda 认为这印证了他的观点:对齐本质上是制度性的而不仅是性格性的——我们训练人向善,但真正起作用的是越界的后果。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →