X 网友推导:策略梯度的 score centering 等价于直通估计器 STE

YouJiacheng · x · 2026-09-20

YouJiacheng 给出一个简洁推导,说明 RL 策略梯度中的 score centering 技巧本质上是一个直通估计器(straight-through estimator)。对 logits 的梯度 s = ea - p,取 q 下的期望得 s̄ = q - p,中心化后 s - s̄ = ea - q,等价于 zp + sg(zq - zp) 这一 STE 形式。作者指出该论证不限于线性策略,并注明解释最初由 @ACSync 发现、另呼应了 @nanjiangcs 的论证。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →