Together AI paper: score centering cancels drift in off-policy RL under train-inference mismatch

PandaAshwinee · x · 2026-09-18

A new paper from Together AI researchers (Martin Marek & Max Ryabinin) targets RL instability caused by train-inference mismatch (TIM).

Related event: Together AI Proposes Score Centering to Fix RL Train-Inference Mismatch(2 posts)→

Original post →

More from Research

Research channel →