研究者推测某 RL 训练采用 DAPO,追问损失异常

一位研究者根据公开训练曲线推测,某团队大概率正在使用 DAPO 或其扩展版本进行强化学习训练:模型在 DeepSWE bench 与 AutomationBench 上的 pass rate 持续上涨。随后作者继续追问训练曲线中的异常现象——损失出现上升,认为这可能反映了异步 RL 训练中更新滞后的情况。

2026-09-18 ~ 2026-09-18 · 2 条相关