reviewer agent 何时不失控:Penn 教授给出可证安全的对偶刻画
Aaroth · x · 2026-09-15
Aaron Roth 针对编码 agent 的「审查员」模式提出一个理论问题:如果驱动 agent 不可信,用来把关的 reviewer agent 自己效用函数也和你不一致,系统还能保证安全吗?他给出非常干净的刻画:在单步决策模型中,系统是安全的,当且仅当 Principal(用户)的效用函数落在所有 reviewer 效用函数的非负张成(non-negative span)之内。正方向证明是初等的,反方向用 LP 对偶性完成。这里的「安全」定义为:Principal 的效用保证不劣于按 baseline 策略行动。这一结果把「auto-approve 是否真安全」从直觉质疑变成可用数学判定的条件。
所属事件:Aaron Roth提出联盟对齐理论:拷问auto-approve安全性(10 条相关)→
「安全」频道最新
- 马斯克提议 AI 实验室互测对方前沿模型:交叉测试更易发现安全问题 — WhatTheLJW · 2026-09-15
- ZDI 披露 Linux 内核 Clsact Qdisc UAF 本地提权漏洞 CVE-2026-23413 — sh4dy_0011 · 2026-09-15
- PNAS 研究:AI 顾问可把用户偏好带偏 38 个百分点且仍获好评 — ValerioCapraro · 2026-09-15
- 民调:61% 美国人反对建 AI 数据中心,年轻人反对最烈 — justin_hart · 2026-09-15
- 让 AI 拥有长期记忆,作为平等一员参与道德话语共同体 — yeastsplainer · 2026-09-15
- Cloudflare Workers 推出细粒度授权,可为 Agent 单独设四种角色权限 — dinasaur_404 · 2026-09-15