联盟对齐扩展到长时程 MDP:Nash 均衡全部安全

Aaroth · x · 2026-09-15

Aaroth 说明其框架可处理长时程智能体:在效用依赖动作与状态、动作改变状态的 MDP 模型下同样得到刻画。利用性能差恒等式,将一次性锥形包刻画(基于 Q 值)提升到完整 MDP;即便驱动 agent 与审稿 agent 完全策略化、各自优化长期折扣收益,在同一非负跨度条件下,博弈的每个 Nash 均衡对 Principal 都是安全的(不劣于基线策略)。

所属事件:Aaron Roth提出联盟对齐理论:拷问auto-approve安全性(10 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →