SGLang 提出增量路由回放,攻克 Kimi K2 RL 训练同步瓶颈

hsu_byron · x · 2026-09-17

Periodic Labs 工程师(转发自 khoomeik)分享了构建 Neon 时的 RL 基础设施细节,核心是减少 RL 训练与推理的不匹配。

背景机制:为最小化训练-推理失配,SGLang 会捕获推理阶段每次 rollout 的 MoE 路由决策,训练时「回放」这些决策。

瓶颈发现:在多轮工具调用的 agentic 设置中,SGLang 会在每轮对话后导出路由决策;任何一个数据并行 rank 完成一轮对话,其他所有 rank 都必须等待路由数据导出完成。更糟的是,导出的是整段对话的路由决策而非仅最新一轮,等待被进一步放大。

解决方案 Delta Router Replay:hsubyron 与 vwxyzjn 在 Kimi K2 的 RL 训练中发现此问题后,提出在训练客户端缓存此前各轮的路由决策,只导出增量(最新一轮的路由决策),大幅减少同步等待。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →