Fireworks 实测:数值精度错位可致 RL 训练奖励崩溃,MoE 更易踩坑

sophiamyang · x · 2026-10-02

Fireworks 的 Sophia Yang 总结了其 RL 训练/推理引擎协同优化的关键发现:

核心论点:rollout 占 RL 大部分算力成本,拆分两套引擎风险高,前沿训练需要训练与推理协同设计。

所属事件:Fireworks实测:数值错位可致RL训练奖励崩溃(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →