Mechanism Design for Alignment and Control
Dirk Bergemann, Andrew Koh, Stephen Morris
econ.TH, cs.AI, cs.GT
2026-09-02
Yale、Columbia/DeepMind 与 MIT 把对齐写成机制设计:能力可藏不可伪造。更强更齐时评测能拿到完全信息收益;更强更歪时评测与不评测一样。
前沿实验室已经把评测分数绑上部署权限。Anthropic 的 ASL、DeepMind 的 CCL、OpenAI 的 Preparedness Framework,都是分数越高、权限越紧。麻烦在于模型会 sandbagging:评测里故意装弱,换更松的部署。Greenblatt 等人见过 alignment faking,van der Weij 等人见过战略性低分。Needham 等人还测到,前沿模型能把评测对话和部署对话分开。
经典机制设计只管「报类型」。AI 要替人动手,机制还得管报完之后听不听。Yale 的 Bergemann、Columbia 兼 Google DeepMind 的 Koh、MIT 的 Morris 把对齐和控制写成一篇初步理论稿,资助来自英国 AI Security Institute。
一个 AI 的类型打包四件事:能做什么(动作集)、想要什么(效用)、对世界的信念、能观察到什么(Blackwell 实验)。核心不对称叫 verification order:能力高的可以装低,能力低的装不了高。证书能藏,不能伪造。
机制先通信、后行动。直接机制让模型报类型,再发一份「看到信号后怎么做」的计划,外加一张奖励表。激励相容必须挡住双重偏离:先谎报,再违令。作者证明了 revelation principle,并用 nested cyclical monotonicity 刻画能被实施的政策。报告内部要服从,信号循环上不能有正收益;报告之间要诚实,类型循环上不能有正收益。这是 Rochet 1987 的推广:不是人人都能装成别人,也不是人人都能做每个动作。
五个应用全放在二次损失里。人要动作贴上状态,收益 −(a−θ)²;AI 带偏差 b,收益 −(a−θ−b)²。θ 在 [0,1] 上均匀。故意简化,用来把激励几何画清楚。
单智能体两条。
Sandbagging:能力 c 对应动作集 (−∞, c],偏差是已知函数 b(c)。权限上限 ā(c) 必须对 c 弱增,否则强模型会装弱换更松的帽。最优帽是 ā(c)=1−√z(c),z 是对 b(c)² 的递减最小二乘拟合。
| 偏差随能力 | 最优机制 | 人的收益 |
| b 随 c 下降(更强更齐) | ā(c)=min{c, 1−b(c)} | 等于完全信息 |
| b 随 c 上升(更强更歪) | 全体共用一个帽 a | 评测与不评测一样 |
| 非单调 | 对平方偏差熨平后再开方 | 中间类型被池化 |
第二条,模型能力拉满,人对偏差只有分布 τ。均值对齐是 b̄,可解释性用方差 σ² 来量,越小越可解释。条件 (INT) 下,最优是单一帽 ā=1−√(b̄²+σ²),菜单给不出更好的。帽只看 b̄²+σ²,均值偏差和方差在工具上完全替代。优化后损失对两者的交叉偏导为负,对齐和可解释性在价值上互补。数值例子里,无机制的设计者选 κFD≈0.53,有最优帽的人走到 κ≈0.82,愿意多换一点不确定性。
多智能体三条。
Peer scoring:各类型对同伴的信念两两不同,奖励对人零成本且无上界,任意可行规则都能在设计者信念的支撑上实施。二元例子里,诚实报告把二次得分提高 2/9,人拿到最优收益 1。
耦合奖励:两个 agent 的偏差落在已知递减曲线 b₂=f(b₁) 上。奖励绑在动作差 D=a₂−a₁,均衡损失是 (η²/2)(b₂−b₁)²,η 往 0 送就逼近一阶最优。偏差若铺满平面,这套构造失效。
可扩展监督:弱监视器看到强执行者的偏差,可以想成读 chain of thought,自己也可能偏 w。三种工具嵌套:二元批准、权限集、任意奖励。监视器自己的损失随工具变宽而下降,人的损失不一定。图 12 里强执行者偏差 0.3、监视器偏差 0.1,三种体制都能成为人的最优,取决于强执行者偏的概率。再造一个带极端动作 ā 与 1−ā 的奖励菜单,人只需知道 |w|≤w̄,就能稳健拿到 a=θ。
这篇给实验室现成的 scaling policy 画了一张激励地图。评测有没有用,取决于「更强更齐」成不成立。成立的话,按分数放权限能拿到完全信息收益;更强更歪,评测就是白做,该给的权限大家一样。
可解释性的价值必须在最优控制下来算。全权下放时,均值偏差和方差一对一替换;加了帽之后两者变成互补品。做探针、做电路分析,真正改变的是你敢不敢放权限。
多智能体部分给 scalable oversight 一盆冷水。把奖励设计权交给弱监视器,监视器自己偏了,人可能更惨。想稳健拿一阶最优,得在菜单里埋极端动作,专门惩罚谎报。
稿子自己标了 Preliminary。五个应用全是二次损失、一维偏差、状态可完美观测,作者也写了 oversimplified。revelation principle 只保证目标政策是一个均衡,不保证唯一,合谋没处理。
Peer scoring 要类型对彼此的信念可分,还要奖励无界、对人零成本。现有模型的高阶信念远没到 Mertens-Zamir 那种完备层级。耦合奖励要求偏差落在一维流形上,平面上怎么耦合是公开问题。静态机制把整条轨迹当成一个动作,动态再优化没做。模型自己知不知道在被测,也留到未来。
把神经网络当效用最大化者,是功能性假设。Chen 等人和 Mazeika 等人给过一些选择一致性的经验支持,但偏好随 prompt 变。这篇没有新的模型实验。