TogetherAI 开源 XoRL:MoE 模型 RL 零训练推理偏差

TogetherAI 团队(@PandaAshwinee)发布并开源了分布式强化学习训练框架 XoRL,宣称在大规模 MoE 模型上实现了 RL 训练与推理之间的零数值偏差(bitwise-identical),并通过消融实验验证其有效性。这一进展解决了异步 RL 中训练与推理引擎计算不一致导致误差累积的老问题,值得关注。

已确认

为什么重要

2026-08-18 ~ 2026-08-18 · 5 条相关

一手来源