Together AI 新论文:分数中心化一个修正项稳住 off-policy RL 训练
PandaAshwinee · x · 2026-09-18
Together AI 的 Martin Marek 与 Max Ryabinin 发布论文《Score Centering Stabilizes Off-policy Reinforcement Learning》,解决 LLM RL 中臭名昭著的训练-推理失配(TIM)问题。
- 问题:训练与推理引擎的微小差异会让 RL 训练极不稳定;彻底消除 TIM 会严重牺牲 rollout 效率,不现实
- 诊断:不稳定的根源是「漂移」——训练与推理引擎之间随每步训练累积的持续性偏差
- 方法:推导出一个加性的「分数中心化」(score centering)修正项,通过抵消漂移来稳定训练
- 结果:在 0.6B–30B 参数模型上训练,单独使用分数中心化即可持平或超过量化条件下基于重要性采样(TIS)的方法,失配越严重差距越大
- 组合:由于修正是加性的,与重要性采样组合后在 staleness 实验中超过纯重要性采样基线
- 实验基于 Qwen3-30B-A3B-Base 在 INTELLECT-2 数学数据上的 RL 训练,覆盖从温和到重度量化场景
所属事件:Together AI 提出分数中心化修正 RL 训练推理失配(2 条相关)→
「研究」频道最新
- 学者吐槽顶会禁改论文标题,呼吁改变学术论文接受后文化 — tianyin_xu · 2026-09-18
- Google 互动练习库已收录 36 个教师审核练习,一次生成仅 3.5% 全过 — xiaohu · 2026-09-18
- 《视觉通用智能》白皮书作者将做客 Video Model Journal Club 深度解读 — HirokatuKataoka · 2026-09-18
- KV cache 最易被误解的一点:token 可以先生成,后进缓存 — techNmak · 2026-09-18
- 神操作:让模型输出 ASCII,非文本生成器秒变自回归 LLM — multiply_matrix · 2026-09-18
- 新论文声称 8.1 Mbps 吞吐,作者称仍有重大物理障碍 — BlancheMinerva · 2026-09-18