ROSS 复用历史 rollout 做选择性监督,SWE-bench Verified 提升4.2个百分点

Zhiwei Zhang · hf · 2026-09-30

论文指出 LLM 后训练产生的自生成 rollout 在策略更新后常被当作过期数据丢弃,但其中仍蕴含可复用的行为经验——只是也混有错误、放弃的尝试与冗余动作,不宜盲目模仿。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →