SGLang 演讲称 RL 后训练本质上是推理问题
BanghuaZ · x · 2026-07-24
这是一场关于 SGLang、RL 后训练和推理一体化的工程分享。
- 演讲者的核心判断是:RL 最贵的部分其实是 rollouts,而 rollouts 本质上就是 serving。
- 因此,推理引擎里的优化,应该能直接沉到 RL 训练框架里复用。
- 现场举的例子是 Miles,一个原生基于 SGLang 的 RL 框架,强调推理栈和训练栈共用同一套系统。
- 这样做的好处是减少训练/推理割裂,避免分叉实现,让优化可以在 serving 和 RL 之间持续复用。
- 配图里还给出一些量化结果:两周做到 500+ TPS,交互性提升 18–34%,以及在 1M context 下 10.17× 的表现。
「编程与Agent」频道最新
- Sol Ultra 卡在文件权限上两天还没启动任务 — snwy_me · 2026-07-24
- Raft 1.0 推出团队模式工作区,专管多智能体协作 — hey_abusiddik · 2026-07-24
- Cognition 联合 LangChain 办 meetup,聊 agent 记忆和 DeepWiki — BraceSproul · 2026-07-24
- Anthropic 工程师称,Claude 应该用系统自我提示来驱动 — mathemagie · 2026-07-24
- Wayfinder 称 AI 交易代理已能每轮自动改策略 — templecrash · 2026-07-24
- 新人想先学会 AI 自动化,再卖给企业客户 — Responsible-Box-4905 · 2026-07-24