Fireworks 揭示 RL 训练数值错位:同算法同数据 25 步内奖励崩溃或稳定

sophiamyang · x · 2026-10-02

Fireworks 的 Sophia Yang 分享了其 RL 训练基础设施的关键发现:

其引用的 Fireworks 官方推文指出,rollout 占 RL 算力成本大头,跨引擎拆分 rollout 与训练正是数值错位风险的来源。

所属事件:Fireworks实测:数值错位可致RL训练奖励崩溃(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →