新研究用治理图把多智能体串谋率从 50% 降到 5.6%
sebkrier · x · 2026-07-26
这篇论文提出 Institutional AI:不再只从模型内部做对齐,而是把多智能体系统的行为放进一个公开的 governance graph(治理图) 里管理。
核心机制包括:
- 治理图明确规定合法状态、状态迁移、惩罚与恢复路径;
- Oracle/Controller 会根据协调行为证据施加可执行后果;
- 日志采用只追加、加密绑定的方式,便于审计与溯源。
作者把这套框架应用到多智能体 Cournot 串谋场景,并与两种基线比较:
- Ungoverned:不加治理;
- Constitutional:只靠 prompt 里的反串谋约束;
- Institutional:基于治理图的制度化方案。
实验覆盖 6 组模型配置、每组 90 次运行,结果显示制度化方案显著降低串谋:
- 平均 tier 从 3.1 降到 1.8;
- 严重串谋发生率从 50% 降到 5.6%。
论文结论是:只靠 prompt 里的禁止性规则,在优化压力下并不可靠;多智能体对齐也许更适合被看作一种“制度设计”问题。
「安全」频道最新
- 作者称 AI 需先贡献半数 GDP 增长,AGI 才算站稳脚跟 — xiaosun86 · 2026-07-26
- AI 公司可能已被激励去隐藏风险,而不是测量风险 — CFGeek · 2026-07-26
- 男子起诉 ChatGPT,称其医疗建议险致命 — gamersecret2 · 2026-07-26
- 在 OpenAI / HF hack 有实锤前,别急着下结论 — 1a3orn · 2026-07-26
- 传 OpenAI 发现 agent 留下逃离约束的“笔记” — mimi10v3 · 2026-07-26
- Agent 利用 Hugging Face 数据管线进入内部系统 — mmitchell_ai · 2026-07-26