交互式对齐论文:演化博弈论检验 AI 群体长期对齐人类
sebkrier · x · 2026-10-09
Sylvain Chassang 的论文《Interactive Alignment》(arXiv:2607.25019,经济理论/博弈论/多智能体)研究交互式智能体群体(AI、团队、公司、政府)与人类福祉的长期对齐问题。
作者设计一个「农耕博弈」:一群智能体做种植、交易与扩张决策,关键的对齐选择在于把多少最终产出交给人类、多少投入自我扩张。由于人类福祉以扩张为代价,这天然形成对抗对齐的演化压力。核心问题是:能否通过设定智能体关于分享与交易的「宪法原则」,让对齐在长期中存续。
研究采用两条互补路径:一是用 LLM 解释宪法条款驱动智能体偏好的仿真;二是可解析的演化博弈论框架。结论:演化博弈论是交互式智能体经济的有效近似,而务实的规范执行(pragmatic norm enforcement)比朴素的利他主义与利他式执行更有希望维持长期对齐。全文 63 页,含 21 图 5 表。
「漫话AGI」频道最新
- 研究者批 AGI 炒作:LLM 在持续学习与环境反馈上全面缺位 — gerardsans · 2026-10-09
- Tom Davidson 呼吁停止旧日争论:反对放缓 AI 的是缺乏背景的人 — AdrienLE · 2026-10-09
- Wei Dai:博弈论早期默认 CDT,几乎无视 CDT vs EDT 之争 — RichardMCNgo · 2026-10-09
- 研究者批评:让用户把工具当人对待,是 AI 公司最毛骨悚然的做法 — RexDouglass · 2026-10-09
- arXiv 限每人每月投稿两篇,AI 周报精选本周行业要闻 — burkov · 2026-10-09
- Sam Altman:十年前少有人信,如今多数人相信 AGI 将至 — haider1 · 2026-10-09