FlashREINFORCE:免 Critic 单轨迹异步 RL,6000+ 次更新稳定训练

青稞AI · wechat · 2026-09-17

面向 Agentic LLM 的异步强化学习方法 FlashREINFORCE(NVIDIA NeMo 团队开源)的技术解读:首个公开并开源 6,000+ 次稳定更新的 critic-free、single-rollout、one-pass 异步 RL 方案。

核心动机:Agent 任务 rollout 节奏不一,单 prompt 单轨迹可把采样预算花在更多不同问题上,且天然契合异步训练;难点在于独立轨迹如何构造反馈、异步漂移如何校正。

三大组件:

关键实验结果:

消融验证:保留正负反馈(36.2 vs positive-only 9.8)、按轨迹平均 loss(截断率 17.2% vs 45.3%)、sequence 级 admission 比 token 级更稳。整套更新无需 critic、ratio clipping 或 reference model 前向。论文与代码已开源。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →