SAT 只对异步强化学习里的陈旧 token 收紧 PPO 裁剪

heghbalz · x · 2026-07-23

研究者提出 SAT(Staleness-Adaptive Trust Regions),用于稳定异步强化学习。

论文的核心问题是:异步 rollout 能提升吞吐,但也会带来 staleness(策略陈旧)——有些 token 由旧策略采样,却在新策略上优化。为此,SAT 不再对所有 token 一视同仁地使用同一套 PPO clipping,而是:

普通 token 仍沿用基线规则,而“拉回”方向的更新则保持开放。

所属事件:腾讯混元推 SAT 稳定异步强化学习训练(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →