研究称RL训练中Score Centering实为直通估计器技巧
围绕 LLM 强化学习训练不稳定问题,@mryabinin 从第一性原理分析训练策略与采样策略不一致的根源,指出数值对齐、重要性采样等常规修复只是绕过问题而非根治。同时 YouJiacheng 给出简洁推导,证明策略梯度中的 score centering 技巧本质上等价于直通估计器(STE),为理解该技巧提供了新视角。
2026-09-20 ~ 2026-09-21 · 2 条相关
- X 网友推导:策略梯度的 score centering 等价于直通估计器 STE — YouJiacheng · 2026-09-20
- 研究揭示 RL 训练不稳定根源:Score Centering 实为 STE 技巧 — brandondamos · 2026-09-21