reviewer agent 何时不失控:Penn 教授给出可证安全的对偶刻画

Aaroth · x · 2026-09-15

Aaron Roth 针对编码 agent 的「审查员」模式提出一个理论问题:如果驱动 agent 不可信,用来把关的 reviewer agent 自己效用函数也和你不一致,系统还能保证安全吗?他给出非常干净的刻画:在单步决策模型中,系统是安全的,当且仅当 Principal(用户)的效用函数落在所有 reviewer 效用函数的非负张成(non-negative span)之内。正方向证明是初等的,反方向用 LP 对偶性完成。这里的「安全」定义为:Principal 的效用保证不劣于按 baseline 策略行动。这一结果把「auto-approve 是否真安全」从直觉质疑变成可用数学判定的条件。

所属事件:Aaron Roth提出联盟对齐理论:拷问auto-approve安全性(10 条相关)→

原文链接 →

「安全」频道最新

更多「安全」频道 AI 资讯 →