ROFT:只用自我复盘解释微调,SWE-bench 成绩追平 GRPO

iScienceLuvr · x · 2026-09-29

arXiv 论文提出 Retrospection-Only Fine-Tuning(ROFT),一种极简的在线训练方法:智能体先尝试任务、观察反馈、生成对自身经验的复盘解释,然后仅用下一个 token 预测损失在解释文本上微调——不需要外部教师,也不需要基于奖励的策略更新。

关键结果:

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →