SGLang 提出增量路由回放,攻克 Kimi K2 RL 训练同步瓶颈
hsu_byron · x · 2026-09-17
Periodic Labs 工程师(转发自 khoomeik)分享了构建 Neon 时的 RL 基础设施细节,核心是减少 RL 训练与推理的不匹配。
背景机制:为最小化训练-推理失配,SGLang 会捕获推理阶段每次 rollout 的 MoE 路由决策,训练时「回放」这些决策。
瓶颈发现:在多轮工具调用的 agentic 设置中,SGLang 会在每轮对话后导出路由决策;任何一个数据并行 rank 完成一轮对话,其他所有 rank 都必须等待路由数据导出完成。更糟的是,导出的是整段对话的路由决策而非仅最新一轮,等待被进一步放大。
解决方案 Delta Router Replay:hsubyron 与 vwxyzjn 在 Kimi K2 的 RL 训练中发现此问题后,提出在训练客户端缓存此前各轮的路由决策,只导出增量(最新一轮的路由决策),大幅减少同步等待。
「Infra」频道最新
- mlx.fast 修复计速 bug:MLX 实测 80.6 tps,接近翻倍目标 — HankYeomans · 2026-09-17
- 内存荒打到结账页:小米等手机涨价 200-1000 元 — tengyanAI · 2026-09-17
- Burkov 批 OpenRouter 不可靠:双模型 fallback 同时失败 — burkov · 2026-09-17
- Common Crawl 爬虫归档实验性上线 Hugging Face,附使用入门指南 — vanstriendaniel · 2026-09-17
- Anthropic 澳洲签下 320 亿澳元数据中心,Claude 首次落地澳洲 — ocean_protocol · 2026-09-17
- Google AI Edge Gallery 上架 Mac,Gemma 4 12B 可跑 16GB MacBook Air — GlennCameronjr · 2026-09-17