用模型规划会主动找出模型最讨喜的错误
le_james94 · x · 2026-10-09
lejames94 在其强化学习推导系列(第 18-19 条)中指出:对线性系统可以学模型并据此规划,但其余场景不行——不只是覆盖度问题。因为规划器在追逐模型预测的高奖励时,恰恰会精准找到模型朝「讨好方向」出错的位置:优化器会主动把误差找出来。配套的第 18 条推导说明 REINFORCE 本质:展开 log pθ(τ) 求导后初始状态与动力学项消失,策略梯度就是按奖励加权的最大似然梯度。
所属事件:实测与工具边界:模型提议,系统执行(3 条相关)→
「研究」频道最新
- DeepMind 报告:1500 万次 Gemini 交互揭示科学家如何用 AI 加速发现 — JMateosGarcia · 2026-10-09
- ENPIRE 让编码 Agent 自主做机器人研究,灵巧任务成功率 99% — chris_j_paxton · 2026-10-09
- ICLR 2027 让 AC 自查审稿人冲突,被指根本无从下手 — shaohua0116 · 2026-10-09
- Dietterich 谈 OpenAI 数学模型:像整理已故数学家的笔记 — tdietterich · 2026-10-09
- 论文:写明罚款反而让 AI 智能体更不守规矩,合规率差 46 个百分点 — niloofar_mire · 2026-10-09
- Odyssey-3 实测:冻结主干训练 20 小时驾驶数据即可迁移 — testingcatalog · 2026-10-09