TogetherAI 开源 XoRL:MoE 模型 RL 零训练推理偏差
TogetherAI 团队(@PandaAshwinee)发布并开源了分布式强化学习训练框架 XoRL,宣称在大规模 MoE 模型上实现了 RL 训练与推理之间的零数值偏差(bitwise-identical),并通过消融实验验证其有效性。这一进展解决了异步 RL 中训练与推理引擎计算不一致导致误差累积的老问题,值得关注。
已确认
- XoRL 已开源,使用 SGLang fork 版本作为推理引擎,严格对齐训练与推理的计算,包括 Kernel 层,实现 0 训练-推理误差
- 在教 Qwen3.6-35B-A3B 玩 Wordle 的任务上验证:零偏差训练将求解率从 63.9% 提升至 77.4%
- 团队进行了多项消融实验验证效果,并探讨了异步 RL 的稳定训练问题
- @marcbhargava 转述称 River API 在 RL 任务中表现优于 Tinker(相同训练代码下结果更优),同样实现大 MoE 的 0 训练-推理偏差
为什么重要
- 训练-推理数值不匹配一直是异步 RL 系统的顽疾,会引入难以定位的偏差并拖累最终性能;Kernel 级 bitwise 对齐为该问题提供了可复用的开源方案
- 消融实验量化了零偏差带来的实际收益(Wordle 求解率提升逾 13 个百分点),为后续 MoE RL 工程实践提供了参考基线
2026-08-18 ~ 2026-08-18 · 5 条相关
一手来源
- TogetherAI 开源 XoRL:消除训练推理误差,提升 MoE 模型 RL 性能 — PandaAshwinee ·
- 详解开源 MoE RL 零偏差训练:原理与消融实验 — PandaAshwinee ·
- 实现 MoE RL 零训练推理偏差,Wordle 任务提升求解率 — PandaAshwinee ·
- 【源头】TogetherAI 开源 XoRL:消除训练推理误差,提升 MoE 模型 RL 性能 — PandaAshwinee · 2026-08-18
- 【源头】实现 MoE RL 零训练推理偏差,Wordle 任务提升求解率 — PandaAshwinee · 2026-08-18
- 【源头】详解开源 MoE RL 零偏差训练:原理与消融实验 — PandaAshwinee · 2026-08-18
- 消除训练推理差异,开源 MoE 模型 RL 方案提升 Wordle 性能 — PandaAshwinee · 2026-08-18
- River API 测试胜出,实现大 MoE 零训练推理偏差 — marcbhargava · 2026-08-18