换个视角看策略梯度:score centering 无需重要性采样

brandondamos · x · 2026-09-22

Yifei Wang 转发并解读 YouJiacheng 关于策略梯度的讨论:传统做法优化 Ep[R] 需要引入大量方差的重要性采样(IS)技术;而 score centering 换了个视角,直接优化 Eq[R]——既然样本本来就来自采样分布 q,就根本不需要 IS。由于无法直接优化 q(推理引擎/旧策略),便用 p 的梯度作为 q 梯度的代理(承认有偏),这正是 STE 估计的思路。

YouJiacheng 补充:该论证不限于线性策略。对 logits 求梯度时,centered score 恰好等于 ea - q,因此 score centering 就是一个 STE:zp + sg(zq - zp)。作者认为这种「从优化 p 目标转向 q 目标」的视角转换带来极大简化。

所属事件:策略梯度 score centering 被证等价于直通估计器(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →