消除训练-推理不一致后,开源 RL 训练解题率 63.9% 升至 77.4%
nrehiew_ · x · 2026-08-19
一篇技术博客(附开源代码)研究开源 RL 训练栈中普遍存在的 train-infer mismatch:推理引擎(SGLang、vLLM、TensorRT-LLM)采样 rollout,训练引擎(Megatron-LM、TorchTitan 等)重算 logprobs,两者可能给出不一致的数值。不一致来源包括浮点归约顺序,以及 GDN、稀疏注意力等架构特有的问题。
核心实验:训练 Qwen3.6-35B-A3B 玩 Wordle,在其自研引擎 XoRL 中让训练与推理(SGLang 分支)产生逐位一致的 logprobs,即 0 mismatch,解题率从 63.9% 提升到 77.4%。作为对照,闭源托管 RL 服务 River 与 Tinker 均用普通重要性采样,实测 mismatch(K3)相近但解题率差异明显;Tinker 在换用 CISPO 损失后表现更好。
文章还讨论了实现 0 mismatch 的代价与收益、替代缓解方案及消融分析,代码全部开源,适用于 DeepSeek、GLM、Qwen 等开源权重 MoE。
所属事件:解决训练与推理不一致,开源RL解题率大幅提升(2 条相关)→
「Infra」频道最新
- 16位模型需60GB显存,4位量化版才塞得进24GB — LeviTurk · 2026-08-19
- 为何去视觉编码器?从基础设施视角看Encoder-Free优势 — liuziwei7 · 2026-08-19
- 矩阵乘法优化上限:数据移动而非乘法次数 — yaroslavvb · 2026-08-19
- 中国建成全球最大单体 AI 园区,欲容纳百万 GPU — teortaxesTex · 2026-08-19
- 美银预言美数据中心三年需 68GW 电力,缺口达 38GW — tctjr · 2026-08-19
- MacBook 本地跑 AI 应用零边际成本,MLX 生态远未消亡 — cocktailpeanut · 2026-08-19