TogetherAI 开源 XoRL:消除训练推理误差,提升 MoE 模型 RL 性能

PandaAshwinee · x · 2026-08-18

TogetherAI 发布并开源了分布式 RL 训练框架 XoRL,通过使用 SGLang fork 版本作为推理引擎,严格对齐训练与推理的计算(包括 Kernel 层),实现了 0 训练-推理误差(bitwise-identical logprobs)。

在 Qwen3.6-35B-A3B 玩 Wordle 的任务中,消除误差将解决率从 63.9% 提升至 77.4%。文章还对比了复用 Router 权重与仅复用索引的策略,指出 0 mismatch 优于 CISPO 等缓解目标,尽管目前对吞吐量有显著影响。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →