ThunderSyncRL 发布:同步式 agentic RL 提速至 1.9 倍

StanfordAILab · x · 2026-10-10

Stanford AI Lab 转发的新项目 ThunderSyncRL,针对同步式 GRPO 类 agentic RL 训练的效率问题,宣称可将训练速度提升至多 1.9 倍,同时保证零策略过期(zero policy staleness)。

所属事件:ThunderSyncRL 发布:同步式智能体 RL 训练提速至 1.9 倍(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →