Gemma Fine-Tuning Hits GRPO Reward Collapse, Outputs Devolve to Gibberish

ivan_bezdomny · x · 2026-08-02

A developer reported an anomaly while fine-tuning a Gemma model: after initially training well, the GRPO reward suddenly dropped to zero. All outputs devolved into repetitive gibberish, a state from which the model could not recover.

Related event: Gemma Fine-tuning Fails as GRPO Reward Drops to Zero(2 posts)→

Original post →

More from Research

Research channel →