RL 训练 rollout 与训练器 logprob 不一致?SkyRL IsoExec 实现跨布局位级对齐
vllm_project · x · 2026-08-21
RL 训练中,vLLM rollout 引擎与 Megatron 训练器即使跑同一策略,也可能因浮点非结合性在 token 的 logprob 上产生分歧。
SkyRL 的 IsoExec 通过「执行契约 + 统一模型」,在 rollout 与训练间对齐对舍入敏感的执行选择,使位级一致(bitwise parity)在不同 TP/EP/SP 并行布局下成立;对 Gated DeltaNet,chunkwise-parallel 循环算法让并行训练/prefill 与循环 decode 位级相同。
实测:Qwen3.5-35B-A3B + DAPO,8×H100,50 步,logprob 差异从 1.6e-2 降至 6.7e-7,全步开销 25.3%,且 vLLM 的调度器与 CUDA graph 仍可用。
「Infra」频道最新
- Parallel Search 发布:面向 AI Agent 的并行搜索基础设施 — dhruv2038 · 2026-08-21
- IBM 开源 Docling 库,可将任何文档转换为数据 — mdancho84 · 2026-08-21
- Starcloud 融资 2.5 亿美元,估值 23 亿美元建太空算力 — ryanbed · 2026-08-21
- Netlify 发布内置 Git 平台 Source:无需 GitHub 账号即可版控 — thisiskp_ · 2026-08-21
- BF16 精度陷阱:+1 后 -1 的往返转换未必无损 — ReinforcedKnowledge · 2026-08-21
- 曝 Google 签署 40 亿美元液冷协议 — citrini · 2026-08-21