Ian Osband:图像分类上 policy gradient 仅 4%,远逊 cross-entropy 的 62%
IanOsband · x · 2026-10-05
DeepMind 研究员 Ian Osband 发推论证:LLM 后训练中大家默认把 policy gradient 当作"唯一的 RL 损失",一旦失败就归咎于探索、信用分配、采样噪声等 RL 通病——但在没有这些问题的图像分类任务上,严格遵循 policy gradient 的效果也很糟糕:ImageNet 上仅 4% 准确率,而 cross-entropy 达 62%。
他用两个例子说明原因:
- 样本 A:答对概率 p=0.9
- 样本 B:答对概率 p=1e-6
对单步微小更新而言,policy gradient 认为没必要花力气改进 B(成功率太低);但从多步训练的整体看,投资 B 的长期收益远高于 A。
他进一步提出概念区分:cross-entropy 是"耐心的准确率"——即无限期训练下去该样本最终会付出的总误差;policy gradient 则是"零视界极限"。把总误差按剩余训练预算截断,就得到一行代码即可实现的"horizon loss"。
所属事件:DeepMind研究员提出horizon loss:统一分类与强化学习(5 条相关)→
「研究」频道最新
- 斯坦福两研究:给 AI 打分的基准测试可能测错了东西 — StanfordHAI · 2026-10-06
- 工程师从博客逆向重建 Neuralink 脑机接口解码器架构 — melnykowycz · 2026-10-06
- 哈佛-MIT 论文:让 agent「提前规划」的提示词反而让决策更差 — dair_ai · 2026-10-06
- 首届人机交互会议 HAIC 2027 官宣:2027 年 6 月落地华盛顿 — jasonwuishere · 2026-10-06
- Gym-Anything 获 COLM 2026 终身智能体研讨会口头报告 — wellecks · 2026-10-06
- Elo 评分失效,作者改用迁移频率归一化给模型排名 — cloneofsimo · 2026-10-06