DeepMind 研究员 Ian Osband 提出 horizon loss,分类与强化学习统一视角
IanOsband · x · 2026-10-05
Ian Osband 介绍其新论文 Planning to Learn 的核心思想:精确的策略梯度是'短视'的——只按当前收益衡量一次更新,而 cross-entropy 则是'耐心准确率'(假设 log-odds 永远以单位速度上升时的总误差),即零视界极限的对偶。把总误差在剩余学习预算处截断就得到 horizon loss,一行代码即可实现,且同样的规划方法也可用于 cross-entropy。核心洞见:'一次更新的价值不必只是某个损失的梯度'。
所属事件:DeepMind研究员提出horizon loss:统一分类与强化学习(5 条相关)→
「研究」频道最新
- 微软 ThinkingBox 开源:不信 agent 的嘴,只查数据库的真实变更 — SergioPaniego · 2026-10-05
- Quanta长文:AI会是数学的终结吗? — littmath · 2026-10-05
- 首个面向公众医疗聊天机器人 RCT:诊断呼吸疾病优于网页搜索 — EricTopol · 2026-10-05
- 局部稀疏性让无监督 LLM 安全检测可行,NeurIPS 论文不依赖 IID 假设 — breadli428 · 2026-10-05
- Eric Topol:RAS 胰腺癌靶向迎重大突破,"不可成药"基因防线松动 — EricTopol · 2026-10-05
- 小型模型自写测试当关卡:77% 的测试误杀正确代码 — deadatreides1 · 2026-10-05