研究者猜测某 RL 训练采用 DAPO 及其扩展,DeepSWE 成绩持续攀升
yuxiangw_cs · x · 2026-09-18
作者根据公开训练曲线推测,该团队大概率在用 DAPO 或其扩展版本做强化学习训练:DeepSWE bench 与 AutomationBench 上的 pass rate 持续上涨,多条 loss 指标也在同步上升。他称这种走势有点反直觉,猜测 loss 指标可能是累积值,或 rollout 长度在训练中变长所致。
所属事件:研究者推测某 RL 训练采用 DAPO,追问损失异常(2 条相关)→
「研究」频道最新
- Anthropic 公布三项 AI 自我研发追踪指标,评论者称尚非可复现科学 — AryHHAry · 2026-09-18
- World-SimReady-Home 家庭仿真数据集登上 Hugging Face 热门 — Yootta · 2026-09-18
- 一个变形球体驱动五种灵巧手:UHAS 跨手协调可视化上线 — YuXiang_IRVL · 2026-09-18
- 砍掉向量数据库,Agent 工具选择召回率不变、成本几乎归零 — BenefitGrand8752 · 2026-09-18
- Epoch AI 启动基准审计:首批 15 个评测仅 4 个获 Verified — xeophon · 2026-09-18
- OpenAI 基金会启动第二个科学计划,超 1.25 亿美元资助健康数据 — owl_posting · 2026-09-18