TogetherAI 开源 XoRL,实现 MoE 模型 RL 零训练推理偏差

TogetherAI 发布并开源了分布式 RL 训练框架 XoRL,通过使用 SGLang fork 版本作为推理引擎,在 Kernel 层面严格对齐训练与推理计算,实现了大规模 MoE 模型 RL 训练与推理之间的零数值偏差。在教 Qwen3.6-35B-A3B 玩 Wordle 的任务中,该方法显著提升求解性能;River API 在相同训练代码下表现优于 Tinker。相关代码已开源。

2026-08-18 ~ 2026-08-18 · 4 条相关