Fireworks 实测:数值精度错位可致 RL 训练奖励崩溃,MoE 更易踩坑
sophiamyang · x · 2026-10-02
Fireworks 的 Sophia Yang 总结了其 RL 训练/推理引擎协同优化的关键发现:
- 数值错位足以毁掉训练:在 GLM 5.2 实验中,同样的算法和数据,不做 numerics 对齐时奖励 25 步内崩溃,对齐后保持稳定
- MoE 模型更复杂:对 Qwen3.5-MoE 的调查发现,expert 输出合并方式的差异会导致 token 被路由到不同 expert,即使一方用了更高精度仍出现分歧
- 这类错位的表现酷似数据、奖励或学习率问题,团队容易陷入昂贵却找不对根因的排错实验
- Fireworks 的方案是把 trainer 与 rollout 引擎一起开发验证,保证跨 numerics、kernels 和 MoE 的对齐
核心论点:rollout 占 RL 大部分算力成本,拆分两套引擎风险高,前沿训练需要训练与推理协同设计。
所属事件:Fireworks实测:数值错位可致RL训练奖励崩溃(2 条相关)→
「Infra」频道最新
- 网友用两台 DGX Spark 加 5090 搭出全本地 LLM 电台 — jwhh91 · 2026-10-02
- 投资人吐槽:多数 neocloud 可靠性只有“九个五”,远不到五个九 — saranormous · 2026-10-02
- 传贷方要求 NVIDIA 芯片贷款需 25% 抵押,算力融资链现裂缝 — GaryMarcus · 2026-10-02
- 微软携 Snowflake 推商业指标标准化,助 AI 工具读懂企业数据 — xiaosun86 · 2026-10-02
- GLM-5.3-Flash NVFP4 的 SGLang 部署配置全公开 — TheZachMueller · 2026-10-02
- GLM-5.3-Flash NVFP4 实测:并发超 8 后单用户速度不再提升 — TheZachMueller · 2026-10-02