Together AI 新论文:分数中心化一个修正项稳住 off-policy RL 训练

PandaAshwinee · x · 2026-09-18

Together AI 的 Martin Marek 与 Max Ryabinin 发布论文《Score Centering Stabilizes Off-policy Reinforcement Learning》,解决 LLM RL 中臭名昭著的训练-推理失配(TIM)问题。

所属事件:Together AI 提出分数中心化修正 RL 训练推理失配(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →