SAO异步强化学习算法在编程推理上超越GRPO

针对长链路Agent任务中异步强化学习的稳定性与离策问题,研究人员提出了单次Rollout异步优化算法(SAO)。实验表明,该算法能稳定训练一千步,并在多个编程与推理基准上持续优于GRPO及其变体。分析指出,SAO的性能提升主要归功于其引入的直接双侧重要性采样(DIS)技术,而非原始的GRPO机制。

2026-07-14 ~ 2026-07-15 · 3 条相关