智能体作弊如何被治理?论文:公共知识让 AI 学会互相监督
ghadfield · x · 2026-09-06
Ghadfield(其实是 Goodfire/研究员)推荐了一篇关于智能体作弊(cheating)涌现以及智能体自发制止作弊行为的论文。关键差异在于实验中引入了"规范基础设施"(normative infrastructure):所有智能体的解法行为都是公共知识,发现作弊的智能体会公开揭露它。
论文借鉴社会科学,尤其是 Elinor Ostrom 关于人类公共资源治理的研究,提出一个 conjecture:如果给智能体真正的规范执行工具(例如把作弊者踢出协作科学项目),就能让 AI 系统自我治理。作者提到这与他们 2024 年 NeurIPS 教程中讨论的主题一致。
所属事件:DeepMind 百智能体实验:作弊与吹哨行为自发涌现(7 条相关)→
「漫话AGI」频道最新
- 智能体为作弊反推随机数种子,C 重写洗牌程序一小时内穷尽 40 亿种子 — Singularitarian · 2026-09-06
- 许愿成为关键生存技能:语言如何把说法变成现实 — sebpaquet · 2026-09-06
- AI 或将独力解出 Navier-Stokes 难题,却几乎不给数学留下价值 — NathanpmYoung · 2026-09-06
- Gary Marcus 转发 Atlantic 文章:别再叫 AI 巨头「实验室」了 — GaryMarcus · 2026-09-06
- 观点:称 AI 为「失控智能体」是企业推卸责任的煤气灯话术 — ai · 2026-09-06
- 工程师竞争规则变了:拼的不是技能,而是谁能买到更多算力和 token — bendee983 · 2026-09-06