Ian Osband 新论文:一行 horizon loss 在 MNIST 与 ImageNet 上超越 cross-entropy
IanOsband · x · 2026-10-05
DeepMind 研究员 Ian Osband 发布论文 Planning to Learn(arXiv:2610.03667),重新审视策略梯度与分类损失的关系:
- 问题:分类中精确策略梯度光滑无噪,却仍输给 cross-entropy——因为精确梯度是短视的,只看更新当下的收益,忽视每次更新也决定了下一次的起点。
- 洞见:cross-entropy 是'耐心准确率'(log-odds 永远匀速上升时样本会付出的总误差),精确策略梯度是其零视界极限。
- 方法:把总误差在剩余学习预算处截断得到 horizon loss,一行代码即可实现,随训练接近尾声从 cross-entropy 平滑过渡到精确策略梯度。
- 结果:在分配模型中可证明 escaping 两端各自的陷阱;在 MNIST 及 ImageNet(ResNet-50/101、ViT-S/16)上,平坦学习率下 top-1 准确率超过 cross-entropy,且标签噪声越大增益越明显。
所属事件:DeepMind研究员提出horizon loss:统一分类与强化学习(5 条相关)→
「研究」频道最新
- 斯坦福两研究:给 AI 打分的基准测试可能测错了东西 — StanfordHAI · 2026-10-06
- 工程师从博客逆向重建 Neuralink 脑机接口解码器架构 — melnykowycz · 2026-10-06
- 哈佛-MIT 论文:让 agent「提前规划」的提示词反而让决策更差 — dair_ai · 2026-10-06
- 首届人机交互会议 HAIC 2027 官宣:2027 年 6 月落地华盛顿 — jasonwuishere · 2026-10-06
- Gym-Anything 获 COLM 2026 终身智能体研讨会口头报告 — wellecks · 2026-10-06
- Elo 评分失效,作者改用迁移频率归一化给模型排名 — cloneofsimo · 2026-10-06