ROSS 复用历史 rollout 做选择性监督,SWE-bench Verified 提升4.2个百分点
Zhiwei Zhang · hf · 2026-09-30
论文指出 LLM 后训练产生的自生成 rollout 在策略更新后常被当作过期数据丢弃,但其中仍蕴含可复用的行为经验——只是也混有错误、放弃的尝试与冗余动作,不宜盲目模仿。
- 提出 ROSS:保留完整历史轨迹作为上下文,但只对选定的模型生成片段施加 loss,实现细粒度选择性监督
- 在领域强化学习、多教师 on-policy 蒸馏、agentic RL 三类场景中均能改进上游 checkpoint,并在数学、代码、指令遵循、软件工程基准上超越基线
- 在 Qwen3.6-35B-A3B 上,六基准 MOPD 平均从 58.40% 升至 62.20%,SWE-bench Verified 从 64.20% 升至 68.40%
- 结论:自 rollout 训练留下的行为经验可通过离线 SFT 进一步兑现,无需额外的策略 rollout
「研究」频道最新
- AI 生成合金微结构:边缘损失+结构相似度损失保住晶界物理意义 — bravo_abad · 2026-09-30
- SOSP26 论文 YoloFS:290 起智能体误删文件报告催生 Agent 原生文件系统 — tianyin_xu · 2026-09-30
- 新论文:Claude Code、Codex 等 Agent 可随意篡改自身执行日志 — maksym_andr · 2026-09-30
- 新加坡国立大学发布 StoryEngine:状态锚定的长篇视频叙事智能体框架 — NationalUniversityofSingapore · 2026-09-30
- AnyStep-WAM:按任务难度自适应分配去噪步数,平均省 60% 步数不掉成功率 — Rui Wang · 2026-09-30
- Sys1Cal-v1 数据集揭示:Jev 概率校准藏着一个「我不知道」第三真值 — Riccardo Porcedda · 2026-09-30