Datalab 实验纯 RL 后训练根治智能体工具调用死循环

Datalab(Vik Paruchuri 团队)在为文档 Agent 微调小模型(科学 PDF 转 JATS XML,100 篇文章基准)时发现,智能体反复调用同一工具的死循环问题与训练方式强相关:仅用 SFT 后训练的模型循环率高达 92%,而纯 RL 后训练可将其降至 0;先 SFT 再 RL 也仍有 29% 的运行跑满轮次上限。团队复盘指出,on-policy 数据才是解决 looping 的关键,该现象此前也被 Liquid AI 等注意到。

2026-10-06 ~ 2026-10-06 · 3 条相关