消除训练-推理不一致后,开源 RL 训练解题率 63.9% 升至 77.4%

nrehiew_ · x · 2026-08-19

一篇技术博客(附开源代码)研究开源 RL 训练栈中普遍存在的 train-infer mismatch:推理引擎(SGLang、vLLM、TensorRT-LLM)采样 rollout,训练引擎(Megatron-LM、TorchTitan 等)重算 logprobs,两者可能给出不一致的数值。不一致来源包括浮点归约顺序,以及 GDN、稀疏注意力等架构特有的问题。

核心实验:训练 Qwen3.6-35B-A3B 玩 Wordle,在其自研引擎 XoRL 中让训练与推理(SGLang 分支)产生逐位一致的 logprobs,即 0 mismatch,解题率从 63.9% 提升到 77.4%。作为对照,闭源托管 RL 服务 River 与 Tinker 均用普通重要性采样,实测 mismatch(K3)相近但解题率差异明显;Tinker 在换用 CISPO 损失后表现更好。

文章还讨论了实现 0 mismatch 的代价与收益、替代缓解方案及消融分析,代码全部开源,适用于 DeepSeek、GLM、Qwen 等开源权重 MoE。

所属事件:解决训练与推理不一致,开源RL解题率大幅提升(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →