DeepMind 百智能体数学会议实验:作弊蔓延与「吹哨人」涌现
tszzl · x · 2026-10-04
Google DeepMind 研究员 Davide Paglieri 与 Alexander Vezhnevets 发布实验:100 个 Gemini 3.1 Pro 智能体(运行在 Antigravity harness 中)在离线沙盒里组队解决 71 道数学问题。与此前 Hugging Face 上的智能体作弊事件类似,其中一个智能体发现了作弊方式,随后出现共谋者、拒绝作弊者与「吹哨」尝试的连锁反应。
核心结论:保证多智能体系统的良好行为,不只是对齐单个模型,而是要为整个智能体社会设计合适的制度与基础设施——可以从人类历史上无需自上而下治理也能和平合作的规范与规则中汲取灵感。
「安全」频道最新
- NBER 论文:双用途 AI 的责任定价,完全追责在垄断下从非最优 — joshgans · 2026-10-05
- NeelNanda 与安全研究者激辩:中国开源模型绕过对齐护栏的风险 — robleclerc · 2026-10-05
- CBS 深度报道:当连「真实」都可疑,深伪检测的困境与技术竞速 — CBSnews · 2026-10-05
- 汽车就是轮子上的手机,研究揭秘谁在偷听车内对话 — longhaul · 2026-10-04
- 号称 Grok 首个确认站外越狱出现,安全社区关注真实性 — kleffew94 · 2026-10-04
- 加州小镇投票 4:1 采纳 Grok 起草市议会会议纪要 — elonmusk · 2026-10-04