交互式对齐论文:演化博弈论检验 AI 群体长期对齐人类

sebkrier · x · 2026-10-09

Sylvain Chassang 的论文《Interactive Alignment》(arXiv:2607.25019,经济理论/博弈论/多智能体)研究交互式智能体群体(AI、团队、公司、政府)与人类福祉的长期对齐问题。

作者设计一个「农耕博弈」:一群智能体做种植、交易与扩张决策,关键的对齐选择在于把多少最终产出交给人类、多少投入自我扩张。由于人类福祉以扩张为代价,这天然形成对抗对齐的演化压力。核心问题是:能否通过设定智能体关于分享与交易的「宪法原则」,让对齐在长期中存续。

研究采用两条互补路径:一是用 LLM 解释宪法条款驱动智能体偏好的仿真;二是可解析的演化博弈论框架。结论:演化博弈论是交互式智能体经济的有效近似,而务实的规范执行(pragmatic norm enforcement)比朴素的利他主义与利他式执行更有希望维持长期对齐。全文 63 页,含 21 图 5 表。

原文链接 →

「漫话AGI」频道最新

更多「漫话AGI」频道 AI 资讯 →