研究者追问异步 RL 训练曲线:损失上升或反映更新滞后

yuxiangw_cs · x · 2026-09-18

在推测某团队采用 DAPO 或其扩展、DeepSWE bench 与 AutomationBench 的 pass rate 持续攀升之后,作者继续追问训练曲线中异常的 loss 走势:他猜测这些持续上升的 loss 指标衡量的可能是异步更新的 staleness(更新滞后程度),而非传统意义上的损失恶化。

所属事件:研究者推测某 RL 训练采用 DAPO,追问损失异常(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →