Fireworks 揭示 RL 训练数值错位:同算法同数据 25 步内奖励崩溃或稳定
sophiamyang · x · 2026-10-02
Fireworks 的 Sophia Yang 分享了其 RL 训练基础设施的关键发现:
- 数值错位可毁掉训练:在 GLM 5.2 实验中,相同算法与数据,无对齐时 reward 在 25 步内崩溃,对齐后保持稳定。
- MoE 增加对齐难度:Qwen3.5-MoE 实验发现,expert 输出的组合方式差异会导致不一致,即使一方使用了更高精度。
- 这类偏差会扭曲训练更新,且症状酷似数据、reward 或学习率问题,让团队陷入昂贵的无效排查。
- 结论:前沿训练需要训练与推理协同优化,Fireworks 将 trainer 与 rollout 引擎联合开发验证,覆盖数值、kernel 与 MoE 层面。
其引用的 Fireworks 官方推文指出,rollout 占 RL 算力成本大头,跨引擎拆分 rollout 与训练正是数值错位风险的来源。
所属事件:Fireworks实测:数值错位可致RL训练奖励崩溃(2 条相关)→
「Infra」频道最新
- 投资人吐槽:投了钱还得求 GPU 厂给被投公司明年配额 — mattturck · 2026-10-02
- Lambda 完成超 10 亿美元 GPU 债务融资,固定利率 6.78% — TheZachMueller · 2026-10-02
- 双 DGX Spark 集群对战 M5 Ultra Mac Studio 实测视频出炉 — AIFlow_ML · 2026-10-02
- 9070 XT 上 SageAttention 提速近 2 倍:作者手写 HIP kernel 并放出 wheel — Familiar_Worry332 · 2026-10-02
- 网友称自托管 GLM 模型在双 RTX 6000 Pro 上跑出 175 tok/s、98% 草稿接受率 — HankYeomans · 2026-10-02
- Cloudflare 开放账户 API Token 自助创建,CLI 一条命令搞定 — irvinebroque · 2026-10-02