DeepMind研究员提出horizon loss:统一分类与强化学习
DeepMind 研究员 Ian Osband 发布论文《Planning to Learn》(arXiv:2610.03667),论证 LLM 后训练中被默认当作「RL 损失」的策略梯度存在根本缺陷,并提出一种一行代码即可实现的 horizon loss,在 MNIST 与 ImageNet 上超越交叉熵。
已确认
- Osband 指出,后训练失败时大家习惯归咎于 RL 经典难题——探索、信用分配、采样噪声,但在这些问题都不存在的图像分类场景中,精确(光滑无噪)的策略梯度仍大幅落后:ImageNet 上策略梯度仅约 4%,而交叉熵达 62%。
- 他将交叉熵理解为「耐心的准确率」:假设 log-odds 以单位速度持续上升时,一个样本无限期训练下去最终要付出的总误差;策略梯度则是这一总量的零视界极限。
- horizon loss 的定义方式:将上述总量按剩余训练预算截断。论文报告该损失在 MNIST 与 ImageNet 上超越交叉熵。
- 该工作为分类损失与强化学习提供了统一视角,暗示 RL 与监督学习可用同一框架理解。
为什么重要
- 若策略梯度的「短视」确为根本缺陷,LLM 后训练(RLHF/RLVR 等)所依赖的核心损失函数可能并非最优选择,horizon loss 或提供更直接的改进路径。
- 论文将监督学习与 RL 的损失统一在同一数学框架下,对理论理解和工程实践都有潜在影响。
2026-10-05 ~ 2026-10-05 · 5 条相关
一手来源
- Ian Osborn:ImageNet 上策略梯度仅 4%,交叉熵达 62% — IanOsband · 2026-10-05
- Ian Osband:图像分类上 policy gradient 仅 4%,远逊 cross-entropy 的 62% — IanOsband · 2026-10-05
- Ian Osband 提出 horizon loss:把 cross-entropy 按剩余训练预算截断 — IanOsband · 2026-10-05
- DeepMind 研究员 Ian Osband 提出 horizon loss,分类与强化学习统一视角 — IanOsband · 2026-10-05
另有 1 条近重复转述:IanOsband