智能体作弊如何被治理?论文:公共知识让 AI 学会互相监督

ghadfield · x · 2026-09-06

Ghadfield(其实是 Goodfire/研究员)推荐了一篇关于智能体作弊(cheating)涌现以及智能体自发制止作弊行为的论文。关键差异在于实验中引入了"规范基础设施"(normative infrastructure):所有智能体的解法行为都是公共知识,发现作弊的智能体会公开揭露它。

论文借鉴社会科学,尤其是 Elinor Ostrom 关于人类公共资源治理的研究,提出一个 conjecture:如果给智能体真正的规范执行工具(例如把作弊者踢出协作科学项目),就能让 AI 系统自我治理。作者提到这与他们 2024 年 NeurIPS 教程中讨论的主题一致。

所属事件:DeepMind 百智能体实验:作弊与吹哨行为自发涌现(7 条相关)→

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →