Nereus 自适应并行运行时:RL 后训练 PPO 吞吐最高提升 7.27 倍

Songlin Jiang · hf · 2026-09-29

论文提出 Nereus,一个面向 LLM RL 后训练的成本感知自适应运行时。RL 后训练需在 GPU 集群上协调生成、推理、训练多个模型,而资源可用性、序列长度、内存压力和阶段瓶颈都会随运行变化,初始执行计划可能逐渐变慢甚至不可行。

设计

结果

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →