Together AI: score centering stabilizes off-policy RL under train-inference mismatch

PandaAshwinee · x · 2026-09-18

A Together AI paper by Martin Marek & Max Ryabinin tackles train-inference mismatch (TIM) in LLM RL.

Related event: Together AI Proposes Score Centering to Fix RL Train-Inference Mismatch(2 posts)→

Original post →

More from Research

Research channel →