研究者猜测某 RL 训练采用 DAPO 及其扩展,DeepSWE 成绩持续攀升

yuxiangw_cs · x · 2026-09-18

作者根据公开训练曲线推测,该团队大概率在用 DAPO 或其扩展版本做强化学习训练:DeepSWE bench 与 AutomationBench 上的 pass rate 持续上涨,多条 loss 指标也在同步上升。他称这种走势有点反直觉,猜测 loss 指标可能是累积值,或 rollout 长度在训练中变长所致。

所属事件:研究者推测某 RL 训练采用 DAPO,追问损失异常(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →