Ian Osband 提出 horizon loss:把 cross-entropy 按剩余训练预算截断

IanOsband · x · 2026-10-05

Ian Osband 技术线程的后续:他定义 cross-entropy 为"耐心的准确率"——即一个样本若无限期训练下去最终要付出的总误差;policy gradient 则是这个总量的零视界极限。将总量按剩余训练预算截断,即得"horizon loss",一行代码即可实现。

这是对前帖论证的收尾:policy gradient 之所以在 ImageNet 上仅 4%(cross-entropy 62%),是因为它放弃了长期视角,而 horizon loss 提供了一个兼顾两者的折中形式。

所属事件:DeepMind研究员提出horizon loss:统一分类与强化学习(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →