Ian Osborn:ImageNet 上策略梯度仅 4%,交叉熵达 62%

IanOsband · x · 2026-10-05

DeepMind 研究员 Ian Osband 指出 LLM 后训练中被当作「RL 损失」的策略梯度本身有根本缺陷。当后训练失败时,大家习惯归咎于 RL 的经典难题——探索、信用分配、采样噪声——但即使在这些问题都不存在的图像分类场景里,策略梯度也是精确的,跟着它走依然效果糟糕:在 ImageNet 上只有 4%,而交叉熵损失达到 62%。

他的论点是:问题不在「RL 难做」,而在策略梯度这个优化目标本身在监督学习式设定下就不可靠,这为反思 LLM 后训练的常用范式提供了实证依据。

所属事件:DeepMind研究员提出horizon loss:统一分类与强化学习(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →