SGLang 演讲称 RL 后训练本质上是推理问题
BanghuaZ · x · 2026-07-24
这是一场关于 SGLang、RL 后训练和推理一体化的工程分享。
- 演讲者的核心判断是:RL 最贵的部分其实是 rollouts,而 rollouts 本质上就是 serving。
- 因此,推理引擎里的优化,应该能直接沉到 RL 训练框架里复用。
- 现场举的例子是 Miles,一个原生基于 SGLang 的 RL 框架,强调推理栈和训练栈共用同一套系统。
- 这样做的好处是减少训练/推理割裂,避免分叉实现,让优化可以在 serving 和 RL 之间持续复用。
- 配图里还给出一些量化结果:两周做到 500+ TPS,交互性提升 18–34%,以及在 1M context 下 10.17× 的表现。
「编程与Agent」频道最新
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11