建模「你 + 审查员 + 驱动者」:三方效用框架如何分析 auto-approve

Aaroth · x · 2026-09-15

Aaron Roth 介绍其研究的建模方式:用户(principal)与各 reviewer agent 都被赋予待最大化的效用函数;driver agent 反复提出动作,reviewer agent 将其与 baseline 比较,依据感知效用投票批准或否决。这一框架把 Codex/Claude Code 式的审批机制形式化,用于分析在 reviewer 与用户效用不一致时系统安全何时可保证(后续帖给出非负张成刻画与 MDP 推广)。

所属事件:Aaron Roth提出联盟对齐理论:拷问auto-approve安全性(10 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →