Fireworks实测:数值错位可致RL训练奖励崩溃

Fireworks 的 Sophia Yang 分享了其 RL 训练基础设施的关键发现:数值精度错位足以毁掉训练。在 GLM 5.2 实验中,使用相同算法与数据,无对齐情况下奖励会在 25 步内崩溃,而正确对齐则保持稳定。该研究还指出 MoE 模型在训练与推理引擎协同优化时更易踩坑,凸显了 RL 训练中数值一致性的重要性。

2026-10-02 ~ 2026-10-02 · 2 条相关