腾讯 Hunyuan 提出 SAT 稳定异步强化学习
Tencent-Hunyuan · hf · 2026-07-22
腾讯 Hunyuan 发布了一篇关于异步强化学习的技术报告,提出 SAT(Staleness-Adaptive Trust Region),目标是缓解 rollout 陈旧带来的训练不稳定。
方法要点
- 用 detach 后的 sampled log-ratio 作为陈旧度的近似指标。
- 通过基于 staleness 的核函数缩放,识别 batch 里 mismatch 最严重的尾部样本。
- 只收缩 PPO 区间里被判断为高风险的一侧,在尽量保持普通 token 行为不变的同时,压住过激更新。
实验结果
- 系统基于 Qwen3-30B-A3B-Base,推理用 SGLang,训练用 Megatron。
- 在异步设置下,SAT-GSPO w/ R3 取得最好结果:AIME24 avg@8 在 lag 1 为 35.83,lag 8 为 34.79。
- 作者认为,adaptive clipping 和 routing replay 结合起来,能更稳地处理异步 RL 中不一致的陈旧度分布。
所属事件:腾讯混元推 SAT 稳定异步强化学习训练(2 条相关)→
「研究」频道最新
- Google 将强化学习引入量子纠错,计算稳定性提升 3.5 倍 — gaganghotra_ · 2026-07-23
- Google Research 研究 AI agent 症状访谈与鉴别诊断 — gaganghotra_ · 2026-07-23
- 六种实用方法追踪并修复 agent 故障回归 — rdbms · 2026-07-23
- OSTP 负责人亲写 Genesis Mission 报告,主打 AI for Science — JungWooHa2 · 2026-07-23
- 信息安全人士称 Hugging Face 沙箱逃逸被严重低估 — proofreadre · 2026-07-23
- Kimi K3 更像差一点,GPT-5.6 Sol 更容易破坏基线 — zainhas · 2026-07-23