SFT再RL仍会死循环:29%跑满轮次上限,on-policy数据才是关键

VikParuchuri · x · 2026-10-06

Datalab(Vik Paruchuri 团队)发布关于 agent 工具调用「循环打转」问题的复盘文章。他们指出 looping 现象并非首次被发现(Liquid AI 等也写过,apapiu 专门研究过文档 agent 中的 tool loop 及其 benchmark、SFT 与 RL 的交互)。

核心发现:

结论对做 agent 训练的团队有直接参考价值:训练数据是否 on-policy,可能比「加一轮 RL」更能决定 agent 是否会卡死在工具调用循环里。

所属事件:Datalab 实验纯 RL 后训练根治智能体工具调用死循环(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →