建模「你 + 审查员 + 驱动者」:三方效用框架如何分析 auto-approve
Aaroth · x · 2026-09-15
Aaron Roth 介绍其研究的建模方式:用户(principal)与各 reviewer agent 都被赋予待最大化的效用函数;driver agent 反复提出动作,reviewer agent 将其与 baseline 比较,依据感知效用投票批准或否决。这一框架把 Codex/Claude Code 式的审批机制形式化,用于分析在 reviewer 与用户效用不一致时系统安全何时可保证(后续帖给出非负张成刻画与 MDP 推广)。
所属事件:Aaron Roth提出联盟对齐理论:拷问auto-approve安全性(10 条相关)→
「研究」频道最新
- Foresight 开放 AI 科学与安全 RFP,单项资助最高 10 万美元 — allisondman · 2026-09-15
- 地震预报给 p(doom) 上的一课:灾难概率到底要多精确 — beenwrekt · 2026-09-15
- Ben Recht 用地震预报类比 p(doom):灾难概率到底算得准吗 — ChuckDBrooks · 2026-09-15
- Meta FAIR 巴黎团队招聘 AI4Maths 博士后与研究员 — TacoCohen · 2026-09-15
- DeepMind 实习成果:把价值图放进 VLM 思维链,多模态潜在推理提效 20% — burny_tech · 2026-09-15
- 用 64 位字替换 Rust 枚举,作者让解释器提速 17% — blaizedsouza · 2026-09-15