Ian Osband 提出 horizon loss:把 cross-entropy 按剩余训练预算截断
IanOsband · x · 2026-10-05
Ian Osband 技术线程的后续:他定义 cross-entropy 为"耐心的准确率"——即一个样本若无限期训练下去最终要付出的总误差;policy gradient 则是这个总量的零视界极限。将总量按剩余训练预算截断,即得"horizon loss",一行代码即可实现。
这是对前帖论证的收尾:policy gradient 之所以在 ImageNet 上仅 4%(cross-entropy 62%),是因为它放弃了长期视角,而 horizon loss 提供了一个兼顾两者的折中形式。
所属事件:DeepMind研究员提出horizon loss:统一分类与强化学习(5 条相关)→
「研究」频道最新
- 斯坦福两研究:给 AI 打分的基准测试可能测错了东西 — StanfordHAI · 2026-10-06
- 工程师从博客逆向重建 Neuralink 脑机接口解码器架构 — melnykowycz · 2026-10-06
- 哈佛-MIT 论文:让 agent「提前规划」的提示词反而让决策更差 — dair_ai · 2026-10-06
- 首届人机交互会议 HAIC 2027 官宣:2027 年 6 月落地华盛顿 — jasonwuishere · 2026-10-06
- Gym-Anything 获 COLM 2026 终身智能体研讨会口头报告 — wellecks · 2026-10-06
- Elo 评分失效,作者改用迁移频率归一化给模型排名 — cloneofsimo · 2026-10-06