研究者推测某 RL 训练采用 DAPO,追问损失异常
一位研究者根据公开训练曲线推测,某团队大概率正在使用 DAPO 或其扩展版本进行强化学习训练:模型在 DeepSWE bench 与 AutomationBench 上的 pass rate 持续上涨。随后作者继续追问训练曲线中的异常现象——损失出现上升,认为这可能反映了异步 RL 训练中更新滞后的情况。
2026-09-18 ~ 2026-09-18 · 2 条相关
- 研究者猜测某 RL 训练采用 DAPO 及其扩展,DeepSWE 成绩持续攀升 — yuxiangw_cs · 2026-09-18
- 研究者追问异步 RL 训练曲线:损失上升或反映更新滞后 — yuxiangw_cs · 2026-09-18