arXiv 新论文提出 k-鲁棒联盟对齐:弱化条件下的 agent 安全授权
Aaroth · x · 2026-09-15
- Aaron Roth 等人发布论文《Delegating Authorization to Misaligned Agents: Coalitional Alignment and Safe Control》。
- 问题设定:长时运行 agent 的每个动作都会改变状态、影响未来轨迹;若 agent 未完全对齐,安全就需要对关键动作人工审批,但逐步审批会让人的注意力成为瓶颈。把审批委托给其他 AI 又引入同样的对齐问题——审核者本身可能不对齐。
- 核心结果:作者刻画了一个比个体对齐更弱、但充要的条件——k-鲁棒联盟对齐(k-robust coalitional alignment)。审核面板采用容忍 k 个否决的阈值规则时,安全性等价于:移除任意 k 个审核者后,委托人效用可写成剩余审核者效用的非负组合加一个非负项。
- 该刻画可推广到序贯控制:在带任意 proposer 的折扣 MDP 中,每个状态安全是充要条件。
- 初步实证发现真实 reward model 之间存在非平凡的安全/完备性权衡,且效应来自联盟而非个体对齐。
所属事件:Aaron Roth提出联盟对齐理论:拷问auto-approve安全性(10 条相关)→
「安全」频道最新
- ZDI 披露 Linux 内核 Clsact Qdisc UAF 本地提权漏洞 CVE-2026-23413 — sh4dy_0011 · 2026-09-15
- PNAS 研究:AI 顾问可把用户偏好带偏 38 个百分点且仍获好评 — ValerioCapraro · 2026-09-15
- 民调:61% 美国人反对建 AI 数据中心,年轻人反对最烈 — justin_hart · 2026-09-15
- 让 AI 拥有长期记忆,作为平等一员参与道德话语共同体 — yeastsplainer · 2026-09-15
- Cloudflare Workers 推出细粒度授权,可为 Agent 单独设四种角色权限 — dinasaur_404 · 2026-09-15
- 医疗 AI 周报:pacing AI 之争发酵,ARPA-H 测试自主临床 AI — HealthcareAIGuy · 2026-09-15