DeepMind Zahavy 用凸 MDP 论文回应「奖励非优化目标」之争
TZahavy · x · 2026-09-12
DeepMind 研究员 Tom Zahavy 针对「Reward is not the optimization target」的简评做出回应,并指向其论文《Reward is enough for convex MDPs》(arXiv:2106.00661,与 Brendan O'Donoghue、Guillaume Desjardins、Satinder Singh 合著)。
- 论文核心:并非所有目标都能用平稳的马尔可夫奖励函数表达,凸 MDP 将标准 RL 泛化为以平稳分布的凸函数表达目标的框架,涵盖学徒学习、约束 MDP、纯探索等监督/无监督 RL 问题。
- 方法:用 Fenchel 对偶把凸 MDP 重构为「策略玩家 vs 代价玩家」的 min-max 博弈,提出统一大量已有算法的元算法。
- 在争论中的位置:该工作支持从「奖励即优化目标」到 KKT 点/不完美记忆博弈均衡的理论刻画,被用来回应奖励相关性的技术讨论,涉及 GRPO 类算法的理想化分析。
「研究」频道最新
- 哥伦比亚大学将办 AI 与基因组学驱动的生物地理学前沿研讨会 — sarameghanbeery · 2026-09-12
- 日本官方办 AI for Science 研讨会,DeepMind 科学家登台分享布局 — heiga_zen · 2026-09-12
- 果蝇全脑模拟学会解魔方,引燃计算主义意识论战 — sebkrier · 2026-09-12
- 25 位菲尔兹奖得主联合警告:AI 目标与数学严重错位 — The Decoder · 2026-09-12
- LuxoBench:用「把渲染图造出来」考核 AI 硬件工程能力 — vincent_koc · 2026-09-12
- Q2D-Web 基准发布:7 万 agent 查询评测 1.9 亿网页检索 — antoine_chaffin · 2026-09-12