ROFT:只用自我复盘解释微调,SWE-bench 成绩追平 GRPO
iScienceLuvr · x · 2026-09-29
arXiv 论文提出 Retrospection-Only Fine-Tuning(ROFT),一种极简的在线训练方法:智能体先尝试任务、观察反馈、生成对自身经验的复盘解释,然后仅用下一个 token 预测损失在解释文本上微调——不需要外部教师,也不需要基于奖励的策略更新。
关键结果:
- 用 Qwen3.5-4B 在混合成功/失败的基座模型尝试数据上训练
- 在 held-out 的 SWE-bench Verified 和 Pro 上分别达到 49.2% 和 26.8% 解题率,20 次更新即可,且不使用 verifier
- 对比 GRPO 在 40 次更新后的 48.0% 和 25.3%,且 ROFT 在训练时间和采样尝试次数上早期进展更快
- 甚至学会了解决基座模型 64 次采样全部失败的任务,说明学习可以在没有任何初始成功轨迹的情况下启动
「编程与Agent」频道最新
- 撤销第三处编辑不伤前两处:AI 文本编辑的变更重放机制 — memokris · 2026-09-29
- Hindsight:把旧复盘经验沉淀为新约束的工程思路 — syedanisafatima · 2026-09-29
- 同一 Prompt 实测:GPT-5.5 vs Sonnet 4 写 Flappy Bird,1.5 年进步肉眼可见 — Dhakkad_Mutthal · 2026-09-29
- 用 AI 一个 App 做出完整万圣节游戏:代码美术音乐全包 — iamfakhrealam · 2026-09-29
- 开源多智能体框架 Raven 0.2.0:自改进 harness 与共享任务图 — nikola_mr64990 · 2026-09-29
- Anthropic 工程师分享如何用主管与 PM 智能体编排 100+ Claude Code 并行 — anthara_ai · 2026-09-29