FlashREINFORCE:免 Critic 单轨迹异步 RL,6000+ 次更新稳定训练
青稞AI · wechat · 2026-09-17
面向 Agentic LLM 的异步强化学习方法 FlashREINFORCE(NVIDIA NeMo 团队开源)的技术解读:首个公开并开源 6,000+ 次稳定更新的 critic-free、single-rollout、one-pass 异步 RL 方案。
核心动机:Agent 任务 rollout 节奏不一,单 prompt 单轨迹可把采样预算花在更多不同问题上,且天然契合异步训练;难点在于独立轨迹如何构造反馈、异步漂移如何校正。
三大组件:
- One-Batch REINFORCE:一批独立 prompt 的轨迹用 batch 平均奖励作 baseline,构造正负反馈,失败轨迹也参与学习,无需 critic;
- Sequence Trust Region:在 token 重要性采样之外,用 Bernoulli KL proxy 衡量整条轨迹的策略漂移,超过阈值则整条轨迹不参与更新;
- Sample-Mean Optimization:先在轨迹内部平均 loss 再跨轨迹平均,避免长失败轨迹仅因 token 多而放大负更新。
关键实验结果:
- DeepSeek-R1-Distill-Qwen-1.5B 长 CoT 数学:policy lag 约 4 下稳定训练 6,000 次更新,AIME24/25 均分 21.7→33.7;
- Qwen2.5-Math-1.5B:256k rollouts 达 38.0 均分,比 GRPO 公开结果(512k rollouts,36.3)高 1.7 分且采样减半;
- Qwen3-30B-A3B 工具任务:policy lag 约 8 下三项均分 67.1,领先 GRPO 6.8 分;
- ALFWorld 成功率 98.3% seen / 96.5% unseen。
消融验证:保留正负反馈(36.2 vs positive-only 9.8)、按轨迹平均 loss(截断率 17.2% vs 45.3%)、sequence 级 admission 比 token 级更稳。整套更新无需 critic、ratio clipping 或 reference model 前向。论文与代码已开源。
「编程与Agent」频道最新
- ScienceIDE 把全球科学代码库变成智能体可学习环境 — Hejia Geng · 2026-09-17
- KAIST 提出 EvolveTrade:用文本化策略自进化 LLM 交易 Agent — kaist-ai · 2026-09-17
- 开发者被 AI 编程工具的错位构建缓存坑掉约一周等待时间 — RileyRalmuto · 2026-09-17
- Agent 重试支付易重复扣款,给写操作加唯一 ID 才能查证 — gethackteam · 2026-09-17
- 开发者开源 synathic:用 Postgres 后验校验戳穿 agent 假报成功 — Gallegos_Daniel · 2026-09-17
- Jitsu 推出 Observability Exports,管道日志直连 Datadog 等 5 家平台 — nikola_mr64990 · 2026-09-17