FlashREINFORCE:单 rollout 异步 RL 训练 LLM,6000+ 步稳定更新
JFPuget · x · 2026-09-14
开源项目 FlashREINFORCE 号称首个无 critic、单 rollout 的异步 LLM 强化学习方案,已稳定跑通 6000+ 次更新。核心组合:One-Batch REINFORCE + 序列信任域(Sequence Trust Region)+ 样本均值优化。
@giffmana 的解读把方法讲得很清楚:
- 与 GRPO 的 32×4(32 组各 4 rollout)不同,FlashREINFORCE 是每 prompt 只采 1 个 rollout,把 128 个 rollout 凑成一个 batch,且每个 batch 只用于一次优化更新
- 关键优势在应对长 rollout 的拖尾(straggler):因为没有组的概念,任何 rollout 不必等同组其他样本完成,500 个 runner 随时把完成的 rollout 进队列,凑满 128 个就成一个 batch
论文与代码均已开源。
所属事件:NVIDIA 开源无 Critic 异步强化学习框架(3 条相关)→
「研究」频道最新
- Berkeley 新数据智能体基准:顶级模型仅通过约三分之一任务 — CShorten30 · 2026-09-14
- ActionSplice:无需回放即可编辑世界模型视频动作序列 — TexasAMUniversity · 2026-09-14
- Kamoun 实验室总结 AI 蛋白质结构预测的十条实战经验 — AllThingsApx · 2026-09-14
- 分析120万份博士论文:政府仍是前沿科技博士培养最大金主 — joshgans · 2026-09-14
- NBER AI经济学大会2026落地多伦多:主题聚焦中国AI — joshgans · 2026-09-14
- 果蝇大脑模型单卡 H100 训练 35 分钟即实现零碰撞自动驾驶 — TinfoilTricorn · 2026-09-14