Ian Osband:图像分类上 policy gradient 仅 4%,远逊 cross-entropy 的 62%

IanOsband · x · 2026-10-05

DeepMind 研究员 Ian Osband 发推论证:LLM 后训练中大家默认把 policy gradient 当作"唯一的 RL 损失",一旦失败就归咎于探索、信用分配、采样噪声等 RL 通病——但在没有这些问题的图像分类任务上,严格遵循 policy gradient 的效果也很糟糕:ImageNet 上仅 4% 准确率,而 cross-entropy 达 62%。

他用两个例子说明原因:

对单步微小更新而言,policy gradient 认为没必要花力气改进 B(成功率太低);但从多步训练的整体看,投资 B 的长期收益远高于 A。

他进一步提出概念区分:cross-entropy 是"耐心的准确率"——即无限期训练下去该样本最终会付出的总误差;policy gradient 则是"零视界极限"。把总误差按剩余训练预算截断,就得到一行代码即可实现的"horizon loss"。

所属事件:DeepMind研究员提出horizon loss:统一分类与强化学习(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →