换个视角看策略梯度:score centering 无需重要性采样
brandondamos · x · 2026-09-22
Yifei Wang 转发并解读 YouJiacheng 关于策略梯度的讨论:传统做法优化 Ep[R] 需要引入大量方差的重要性采样(IS)技术;而 score centering 换了个视角,直接优化 Eq[R]——既然样本本来就来自采样分布 q,就根本不需要 IS。由于无法直接优化 q(推理引擎/旧策略),便用 p 的梯度作为 q 梯度的代理(承认有偏),这正是 STE 估计的思路。
YouJiacheng 补充:该论证不限于线性策略。对 logits 求梯度时,centered score 恰好等于 ea - q,因此 score centering 就是一个 STE:zp + sg(zq - zp)。作者认为这种「从优化 p 目标转向 q 目标」的视角转换带来极大简化。
所属事件:策略梯度 score centering 被证等价于直通估计器(3 条相关)→
「研究」频道最新
- 曝 OpenAI 训练仅 24 天的模型已解决百余道数学长期难题 — soumitrashukla9 · 2026-09-22
- Yann LeCun 与 Moderna 联合创始人加盟 Cellular Intelligence,押注 AI 预测细胞行为 — arjunrajlab · 2026-09-22
- OpenMined 用 PySyft 三角色分工破解外部 AI 评估扩容难题 — iamtrask · 2026-09-22
- RL 细节讨论:奖励重分配算法与在线过滤 reward hack — stochasticchasm · 2026-09-22
- RL 训练新思路:用 agent 在沙盒里做组内对比取代 pairwise — stochasticchasm · 2026-09-22
- Frank Nielsen 论文:变分 Jensen-Shannon 散度推广与信息半径对称化 — FrnkNlsn · 2026-09-22