DeepMind Zahavy 用凸 MDP 论文回应「奖励非优化目标」之争

TZahavy · x · 2026-09-12

DeepMind 研究员 Tom Zahavy 针对「Reward is not the optimization target」的简评做出回应,并指向其论文《Reward is enough for convex MDPs》(arXiv:2106.00661,与 Brendan O'Donoghue、Guillaume Desjardins、Satinder Singh 合著)。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →