DeepMind研究员提出horizon loss:统一分类与强化学习

DeepMind 研究员 Ian Osband 发布论文《Planning to Learn》(arXiv:2610.03667),论证 LLM 后训练中被默认当作「RL 损失」的策略梯度存在根本缺陷,并提出一种一行代码即可实现的 horizon loss,在 MNIST 与 ImageNet 上超越交叉熵。

已确认

为什么重要

2026-10-05 ~ 2026-10-05 · 5 条相关

一手来源

另有 1 条近重复转述:IanOsband