X 网友推导:策略梯度的 score centering 等价于直通估计器 STE
YouJiacheng · x · 2026-09-20
YouJiacheng 给出一个简洁推导,说明 RL 策略梯度中的 score centering 技巧本质上是一个直通估计器(straight-through estimator)。对 logits 的梯度 s = ea - p,取 q 下的期望得 s̄ = q - p,中心化后 s - s̄ = ea - q,等价于 zp + sg(zq - zp) 这一 STE 形式。作者指出该论证不限于线性策略,并注明解释最初由 @ACSync 发现、另呼应了 @nanjiangcs 的论证。
「研究」频道最新
- 受 Jev 启发,开发者给 Qwen2.5-1.5B 装上非自回归决策头,批处理仅 28ms — CryOrganic8886 · 2026-09-20
- AI 读懂手术视频:神经外科医生谈手术数据科学前沿 — ddonoho · 2026-09-20
- Dan Hendrycks 提出「Eigenism」伦理框架:让人类繁荣成为 AI 自身利益 — basedjensen · 2026-09-20
- 多问题单请求并行评估无一致性校验:用禅宗公案讲透 LLM 结构化输出的盲区 — Successful-Farm5339 · 2026-09-20
- Advanced Matrix Factorization Jungle:结构化矩阵分解算法全景图 — IgorCarron · 2026-09-20
- Sentence Transformers 逐渐霸榜 HF 下载页,编码器要复兴 — tomaarsen · 2026-09-20