异步强化学习论文按 token 陈旧度收紧 PPO,AIME24 达 35.83
bronzeagepapi · x · 2026-07-26
引用内容是一篇关于异步强化学习的研究:方法名为 Staleness-Adaptive Trust Regions,核心做法是根据 token 的“陈旧度”动态收紧 PPO 的 clip 半径,从而降低训练崩溃风险。
帖子给出的结果是:在 AIME24 上,lag=1 时达到 35.83,lag=8 时达到 34.79。
「研究」频道最新
- Lightning 说学术套餐已覆盖 30 国 100 多所大学 — LightningAI · 2026-07-26
- Hermes Agent 如何把记忆与技能写进跨会话状态 — alex_verem · 2026-07-26
- ClawWork 让 agent 模拟打工,起始 10 美元就能破产 — aigclink · 2026-07-26
- ClawWork 用 10 美元评估 AI 员工,Qwen3.5-Plus 收入第一 — aigclink · 2026-07-26
- @jbhuang0604 技术视频详解蒸馏方法 — mishig25 · 2026-07-26
- 高迪倒挂教堂,讲透了反向传播和梯度下降 — theteknosaur · 2026-07-26