TogetherAI 开源 XoRL:消除训练推理误差,提升 MoE 模型 RL 性能
PandaAshwinee · x · 2026-08-18
TogetherAI 发布并开源了分布式 RL 训练框架 XoRL,通过使用 SGLang fork 版本作为推理引擎,严格对齐训练与推理的计算(包括 Kernel 层),实现了 0 训练-推理误差(bitwise-identical logprobs)。
在 Qwen3.6-35B-A3B 玩 Wordle 的任务中,消除误差将解决率从 63.9% 提升至 77.4%。文章还对比了复用 Router 权重与仅复用索引的策略,指出 0 mismatch 优于 CISPO 等缓解目标,尽管目前对吞吐量有显著影响。
「Infra」频道最新
- 详解开源 MoE RL 零偏差训练:原理与消融实验 — PandaAshwinee · 2026-08-18
- 实现 MoE RL 零训练推理偏差,Wordle 任务提升求解率 — PandaAshwinee · 2026-08-18
- 学生借到 16 张 H100 一周:从零搭推理集群并规模化部署 — TheZachMueller · 2026-08-18
- 谷歌拟千万美元购 Spirit 航空内部数据用于训练 — abhiadesai · 2026-08-18
- 单用户场景:LLama.cpp 优于 VLLM 吗? — Civil_Fee_7862 · 2026-08-18
- 实测揭示上下文压缩是陷阱,提示词缓存完胜 — AI Engineer · 2026-08-18