Fireworks Finds Numerical Misalignment Can Crash RL Training Rewards
Fireworks' Sophia Yang revealed that numerical misalignment between training and inference can destroy RL training: in GLM 5.2 experiments, identical algorithms and data led to reward collapse within 25 steps without alignment. MoE models are particularly vulnerable.
2026-10-02 ~ 2026-10-02 · 2 related posts
- Fireworks shows numerical mismatch can collapse RL training in 25 steps on GLM and MoE models — sophiamyang · 2026-10-02
- Fireworks: numerical mismatches can collapse RL reward training, MoE makes it worse — sophiamyang · 2026-10-02