Fireworks Finds Numerical Misalignment Can Crash RL Training Rewards

Fireworks' Sophia Yang revealed that numerical misalignment between training and inference can destroy RL training: in GLM 5.2 experiments, identical algorithms and data led to reward collapse within 25 steps without alignment. MoE models are particularly vulnerable.

2026-10-02 ~ 2026-10-02 · 2 related posts