从第一性原理拆解 RL 不稳定根源,Score Centering 直接抵消

_AndrewZhao · x · 2026-09-19

RL with LLMs 在训练策略与采样策略数值不一致(training/sampling mismatch)时非常不稳定,标准修法如数值对齐、重要性采样只是绕过问题。这条线程称从第一性原理找到了不稳定性的根因,并提出直接将其抵消的方法——Score Centering:实现简单,性能有竞争力,且可与现有方法叠加使用。

所属事件:Together AI 提出分数中心化,修正 RL 训练-推理失配(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →