Google DeepMind trains Gemini models to self-correct with self-generated RL data

heghbalz · x · 2026-07-27

Google DeepMind proposes SCoRe for self-correction

Google DeepMind’s paper “Training Language Models to Self-Correct via Reinforcement Learning” introduces SCoRe, a multi-turn online RL method that trains on the model’s own self-generated correction traces instead of offline human or model-generated correction data.

Key points:

Original post →

More from Research

Research channel →