Ian Osborn:ImageNet 上策略梯度仅 4%,交叉熵达 62%
IanOsband · x · 2026-10-05
DeepMind 研究员 Ian Osband 指出 LLM 后训练中被当作「RL 损失」的策略梯度本身有根本缺陷。当后训练失败时,大家习惯归咎于 RL 的经典难题——探索、信用分配、采样噪声——但即使在这些问题都不存在的图像分类场景里,策略梯度也是精确的,跟着它走依然效果糟糕:在 ImageNet 上只有 4%,而交叉熵损失达到 62%。
他的论点是:问题不在「RL 难做」,而在策略梯度这个优化目标本身在监督学习式设定下就不可靠,这为反思 LLM 后训练的常用范式提供了实证依据。
所属事件:DeepMind研究员提出horizon loss:统一分类与强化学习(5 条相关)→
「研究」频道最新
- Frank Nielsen《信息几何入门》短教材 PDF 免费分享 — FrnkNlsn · 2026-10-05
- 微软 ThinkingBox 开源:不信 agent 的嘴,只查数据库的真实变更 — SergioPaniego · 2026-10-05
- Quanta长文:AI会是数学的终结吗? — littmath · 2026-10-05
- 首个面向公众医疗聊天机器人 RCT:诊断呼吸疾病优于网页搜索 — EricTopol · 2026-10-05
- 局部稀疏性让无监督 LLM 安全检测可行,NeurIPS 论文不依赖 IID 假设 — breadli428 · 2026-10-05
- Eric Topol:RAS 胰腺癌靶向迎重大突破,"不可成药"基因防线松动 — EricTopol · 2026-10-05