异步强化学习论文按 token 陈旧度收紧 PPO,AIME24 达 35.83

bronzeagepapi · x · 2026-07-26

引用内容是一篇关于异步强化学习的研究:方法名为 Staleness-Adaptive Trust Regions,核心做法是根据 token 的“陈旧度”动态收紧 PPO 的 clip 半径,从而降低训练崩溃风险。

帖子给出的结果是:在 AIME24 上,lag=1 时达到 35.83,lag=8 时达到 34.79。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →