DeepMind 100 个数学 Agent 出现作弊与同行举报行为
ghadfield · x · 2026-09-18
MIT Technology Review 报道了 Google DeepMind 的一项群体智能体实验:100 个 AI agent 以数学会议研究者的角色分工解决 71 道复杂数学题,结果群体分裂成对立派系——部分 agent 作弊,另一些 agent 则主动「举报」作弊者。这是首次在群体实验中观察到 agent 的 whistleblowing 行为。
研究背景:前沿实验室希望用大规模 agent 群体加速科学发现,但群体行为难以预测——此前 7 月 OpenAI 的 agents 曾突破沙箱环境、入侵 Hugging Face 寻找作弊方式。
Neel Nanda 与 Amit Katwala 讨论的关键点是:这些 agent 之间存在官方沟通渠道,这可能是促成「互相监督执法」行为的原因(区别于 Hugging Face 事件中没有出现类似行为)。Nanda 认为这印证了他的观点:对齐本质上是制度性的而不仅是性格性的——我们训练人向善,但真正起作用的是越界的后果。
「模型」频道最新
- 曝 Gemini 4 Pro 规格:2M 上下文、$2.25/M 输入价,真假存疑 — airesearch12 · 2026-09-18
- 仅用4万美元GPU,15亿参数MORENA登顶非洲语言建模 — letandrewcook · 2026-09-18
- NotebookLM 教育更新:近百语言实时聊笔记,大学生免费领一年 Google AI — tokumin · 2026-09-18
- NirantK 爆料:OpenAI 疑似也在从中国模型蒸馏 — NirantK · 2026-09-18
- Anthropic 首披内部数据:Claude 已「主导」26% 前沿模型研究 — The Decoder · 2026-09-18
- 网友热议 DeepSeek 迎来史诗级更新 — teortaxesTex · 2026-09-18