Aaron Roth提出联盟对齐理论:拷问auto-approve安全性
Aaron Roth(宾大教授)团队于09-15在arXiv发布论文《Delegating Authorization to Misaligned Agents: Coalitional Alignment and Safe Control》,直接拷问Codex与Claude Code的自动批准(auto-approve)特性:这类机制让reviewer agent代替用户把关,营造「安全」的感觉,但其前提是你信任这个reviewer agent——如果你不信任写代码的驱动agent,凭什么信任审查它的另一个agent?thomasahle转述并呼应了这一质疑。
已确认
- 研究建模为三方框架:用户(Principal)与各reviewer agent均持有各自效用函数;驱动agent反复提出动作,reviewer agent将其与baseline比较并投票批准或否决,难点在reviewer agent与用户效用不一致。
- 核心结论:在单步决策模型中给出干净的刻画——无需每个reviewer agent精确持有你的效用,只需满足更弱的「联盟对齐(coalitional alignment)」条件即可保证安全,即k-鲁棒的联盟对齐作为弱条件下的安全授权依据。
- 该刻画可推广到长时程MDP:效用依赖动作与状态、动作会改变状态,即便驱动agent与审稿agent完全策略化;核心工具是性能差恒等式(performance difference lemma),将一次性基于Q值的锥形包刻画提升到完整MDP,且Nash均衡全部安全。
- 对真实奖励模型的初步实验显示联盟对齐条件不必然满足,存在非平凡的安全/完备性权衡,这些效应来自联盟层面而非个体层面,为多智能体治理机制提供实证线索。
为什么重要
- Auto-approve正成为主流编码agent的默认体验,该工作首次为「委托审查」模式给出可证安全的形式化条件,指出现有产品的安全感缺乏理论根基。
- 联盟对齐是比逐一审查弱得多的实用条件,若业界采纳,可为agent授权机制设计提供明确的安全边界与验证标准。
2026-09-15 ~ 2026-09-15 · 10 条相关
一手来源
- arXiv 新论文提出 k-鲁棒联盟对齐:弱化条件下的 agent 安全授权 — Aaroth ·
- Auto-approve 真的安全吗?Codex 与 Claude Code 审查员模式遭理论拷问 — Aaroth ·
- 真实奖励模型初现联盟对齐的安全-完备性权衡 — Aaroth ·
- 【源头】Auto-approve 真的安全吗?Codex 与 Claude Code 审查员模式遭理论拷问 — Aaroth · 2026-09-15
- 建模「你 + 审查员 + 驱动者」:三方效用框架如何分析 auto-approve — Aaroth · 2026-09-15
- 审稿 agent 效用不一致时,如何仍保证系统安全 — Aaroth · 2026-09-15
- reviewer agent 何时不失控:Penn 教授给出可证安全的对偶刻画 — Aaroth · 2026-09-15
- 从单步到长程 agent:效用刻画推广到 MDP 仍成立 — Aaroth · 2026-09-15
- Arvind Rajeswaran 提出「联盟对齐」弱条件可保证多智能体安全 — Aaroth · 2026-09-15
- 联盟对齐扩展到长时程 MDP:Nash 均衡全部安全 — Aaroth · 2026-09-15
- 【源头】真实奖励模型初现联盟对齐的安全-完备性权衡 — Aaroth · 2026-09-15
- 【源头】arXiv 新论文提出 k-鲁棒联盟对齐:弱化条件下的 agent 安全授权 — Aaroth · 2026-09-15
- 不信任写代码的 agent,为何信审查它的 agent? — thomasahle · 2026-09-15