用模型规划会主动找出模型最讨喜的错误

le_james94 · x · 2026-10-09

lejames94 在其强化学习推导系列(第 18-19 条)中指出:对线性系统可以学模型并据此规划,但其余场景不行——不只是覆盖度问题。因为规划器在追逐模型预测的高奖励时,恰恰会精准找到模型朝「讨好方向」出错的位置:优化器会主动把误差找出来。配套的第 18 条推导说明 REINFORCE 本质:展开 log pθ(τ) 求导后初始状态与动力学项消失,策略梯度就是按奖励加权的最大似然梯度。

所属事件:实测与工具边界:模型提议,系统执行(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →