Together AI 提出分数中心化修正 RL 训练推理失配

Together AI 研究员 Martin Marek 与 Max Ryabinin 等发布新论文《Score Centering Stabilizes Off-policy Reinforcement Learning》,针对 RL 训练-推理失配(TIM)提出原理性修正方法。论文指出 TIM 下 RL 不稳定的根源,并展示仅通过分数中心化这一修正项即可稳定 off-policy RL 训练。

2026-09-18 ~ 2026-09-18 · 2 条相关

另有 1 条近重复转述:PandaAshwinee