ThunderSyncRL 发布:同步式智能体 RL 训练提速至 1.9 倍

研究者 hangookang 与 seilk 联合发布 ThunderSyncRL 项目,Stanford AI Lab 也进行了转发。该项目针对同步式 GRPO 类 agentic RL 训练的效率问题,通过将梯度计算与 rollout 采样重叠这一关键优化,宣称可将训练速度提升至多 1.9 倍。

2026-10-08 ~ 2026-10-10 · 2 条相关