RL 训练 rollout 与训练器 logprob 不一致?SkyRL IsoExec 实现跨布局位级对齐

vllm_project · x · 2026-08-21

RL 训练中,vLLM rollout 引擎与 Megatron 训练器即使跑同一策略,也可能因浮点非结合性在 token 的 logprob 上产生分歧。

SkyRL 的 IsoExec 通过「执行契约 + 统一模型」,在 rollout 与训练间对齐对舍入敏感的执行选择,使位级一致(bitwise parity)在不同 TP/EP/SP 并行布局下成立;对 Gated DeltaNet,chunkwise-parallel 循环算法让并行训练/prefill 与循环 decode 位级相同。

实测:Qwen3.5-35B-A3B + DAPO,8×H100,50 步,logprob 差异从 1.6e-2 降至 6.7e-7,全步开销 25.3%,且 vLLM 的调度器与 CUDA graph 仍可用。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →