NVIDIA 开源 ProRL Agent:以 Rollout 即服务解耦 Agent 强化学习瓶颈

burkov · x · 2026-09-30

多轮 LLM Agent(软件开发、科研、网页操作等)的改进依赖强化学习,而 RL 需要在外部环境中生成数千次交互式试跑(rollout)。现有训练系统把 rollout 的执行与管理直接嵌入 ML 训练循环,导致 I/O 密集的环境模拟与计算密集的模型优化互相干扰,形成严重的运维瓶颈,也难以跨框架迁移和横向扩展。

NVIDIA 的文章介绍并评测了开源的 ProRL Agent,采用 "rollout-as-a-service"(rollout 即服务)架构,将 rollout 基础设施从训练循环中解耦出来,以解决上述瓶颈。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →