从单步到长程 agent:效用刻画推广到 MDP 仍成立
Aaroth · x · 2026-09-15
Aaron Roth 继续其 reviewer-agent 安全性研究,将单步决策的刻画推广到长时间运行的 agent:建模为 MDP,效用依赖动作与状态,动作会改变状态。核心工具是「性能差恒等式」(performance difference identity),把单步的非负锥包刻画提升到 Q 值层面,从而得到完整 MDP 下的安全条件。结论是:即使驱动 agent 任意不可信,只要 reviewer 效用的结构条件满足,长程系统的安全性仍有保证。
所属事件:Aaron Roth提出联盟对齐理论:拷问auto-approve安全性(10 条相关)→
「研究」频道最新
- Foresight 开放 AI 科学与安全 RFP,单项资助最高 10 万美元 — allisondman · 2026-09-15
- 地震预报给 p(doom) 上的一课:灾难概率到底要多精确 — beenwrekt · 2026-09-15
- Ben Recht 用地震预报类比 p(doom):灾难概率到底算得准吗 — ChuckDBrooks · 2026-09-15
- Meta FAIR 巴黎团队招聘 AI4Maths 博士后与研究员 — TacoCohen · 2026-09-15
- DeepMind 实习成果:把价值图放进 VLM 思维链,多模态潜在推理提效 20% — burny_tech · 2026-09-15
- 用 64 位字替换 Rust 枚举,作者让解释器提速 17% — blaizedsouza · 2026-09-15