新研究用治理图把多智能体串谋率从 50% 降到 5.6%

sebkrier · x · 2026-07-26

这篇论文提出 Institutional AI:不再只从模型内部做对齐,而是把多智能体系统的行为放进一个公开的 governance graph(治理图) 里管理。

核心机制包括:

作者把这套框架应用到多智能体 Cournot 串谋场景,并与两种基线比较:

实验覆盖 6 组模型配置、每组 90 次运行,结果显示制度化方案显著降低串谋:

论文结论是:只靠 prompt 里的禁止性规则,在优化压力下并不可靠;多智能体对齐也许更适合被看作一种“制度设计”问题。

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →