DeepMind 研究员 Ian Osband 提出 horizon loss,分类与强化学习统一视角

IanOsband · x · 2026-10-05

Ian Osband 介绍其新论文 Planning to Learn 的核心思想:精确的策略梯度是'短视'的——只按当前收益衡量一次更新,而 cross-entropy 则是'耐心准确率'(假设 log-odds 永远以单位速度上升时的总误差),即零视界极限的对偶。把总误差在剩余学习预算处截断就得到 horizon loss,一行代码即可实现,且同样的规划方法也可用于 cross-entropy。核心洞见:'一次更新的价值不必只是某个损失的梯度'。

所属事件:DeepMind研究员提出horizon loss:统一分类与强化学习(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →