Nereus 自适应并行运行时:RL 后训练 PPO 吞吐最高提升 7.27 倍
Songlin Jiang · hf · 2026-09-29
论文提出 Nereus,一个面向 LLM RL 后训练的成本感知自适应运行时。RL 后训练需在 GPU 集群上协调生成、推理、训练多个模型,而资源可用性、序列长度、内存压力和阶段瓶颈都会随运行变化,初始执行计划可能逐渐变慢甚至不可行。
设计
- 低开销控制器选择内存可行的全局计划,用针对当前任务校准的成本模型决定是否值得承担迁移开销
- 将模型-阶段每个副本的分布式状态表示为 Elastic Model Unit,用全局迁移图排序变换与 GPU 传输
结果
- 真实数据 trace 中,在线 TP/PP 自适应使平均步延迟较初始固定布局 + DP 扩展降低 27.7%
- 1024 GPU、1000 步运行中 6 次迁移仅占总耗时 0.079%
- 端到端 8B PPO 吞吐较 OpenRLHF 提升 2.14–7.27 倍,较 Verl 提升 1.10–1.47 倍
「Infra」频道最新
- 开源项目 Celesto:给 AI Agent 一台 500 毫秒启动的专属电脑 — aniketmaurya · 2026-09-29
- 算账:Meta Muse 即便激进优化,每用户年成本也达 50 美元 — bookwormengr · 2026-09-29
- 手机+三台 Mac+两台 PC 拼出 60GB 内存,跑通 gpt-oss-120b — ANR2ME · 2026-09-29
- BioNeMo 团队优化稀疏模型训练:Mixtral 吞吐提升 2.21 倍 — AllThingsApx · 2026-09-29
- DeepSeek 弹性计算团队大量招人,发布大规模 Agent 训练沙盒基建分享 — teortaxesTex · 2026-09-29
- 开发者吐槽第三方推理服务乱象:Gemini 一年涨 10 倍 — julianharris · 2026-09-29