研究揭示 RL 训练不稳定根源:Score Centering 实为 STE 技巧

brandondamos · x · 2026-09-21

@mryabinin 提出从第一性原理分析 LLM 强化学习中训练策略与采样策略不一致导致的训练不稳定问题,指出常规修复(数值对齐、重要性采样)只是绕过而非根治,并提出 Score Centering 直接抵消该不稳定性,实现简单且兼容现有方法。

@YouJiacheng 补充观察:Score Centering 本质上「偷偷」就是一个 STE(直通估计器),形式为 zp + sg(zq - zp)。

所属事件:研究称RL训练中Score Centering实为直通估计器技巧(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →