Fireworks实测:数值错位可致RL训练奖励崩溃
Fireworks 的 Sophia Yang 分享了其 RL 训练基础设施的关键发现:数值精度错位足以毁掉训练。在 GLM 5.2 实验中,使用相同算法与数据,无对齐情况下奖励会在 25 步内崩溃,而正确对齐则保持稳定。该研究还指出 MoE 模型在训练与推理引擎协同优化时更易踩坑,凸显了 RL 训练中数值一致性的重要性。
2026-10-02 ~ 2026-10-02 · 2 条相关
- Fireworks 揭示 RL 训练数值错位:同算法同数据 25 步内奖励崩溃或稳定 — sophiamyang · 2026-10-02
- Fireworks 实测:数值精度错位可致 RL 训练奖励崩溃,MoE 更易踩坑 — sophiamyang · 2026-10-02