研究称RL训练中Score Centering实为直通估计器技巧

围绕 LLM 强化学习训练不稳定问题,@mryabinin 从第一性原理分析训练策略与采样策略不一致的根源,指出数值对齐、重要性采样等常规修复只是绕过问题而非根治。同时 YouJiacheng 给出简洁推导,证明策略梯度中的 score centering 技巧本质上等价于直通估计器(STE),为理解该技巧提供了新视角。

2026-09-20 ~ 2026-09-21 · 2 条相关