Datalab 实验纯 RL 后训练根治智能体工具调用死循环
Datalab(Vik Paruchuri 团队)在为文档 Agent 微调小模型(科学 PDF 转 JATS XML,100 篇文章基准)时发现,智能体反复调用同一工具的死循环问题与训练方式强相关:仅用 SFT 后训练的模型循环率高达 92%,而纯 RL 后训练可将其降至 0;先 SFT 再 RL 也仍有 29% 的运行跑满轮次上限。团队复盘指出,on-policy 数据才是解决 looping 的关键,该现象此前也被 Liquid AI 等注意到。
2026-10-06 ~ 2026-10-06 · 3 条相关
- 纯 RL 后训练消灭智能体工具调用死循环:SFT 循环率 92% 降至 0 — VikParuchuri · 2026-10-06
- Datalab 实测:纯 RL 训练让 Agent 零死循环,SFT 循环率高达 92% — VikParuchuri · 2026-10-06
- SFT再RL仍会死循环:29%跑满轮次上限,on-policy数据才是关键 — VikParuchuri · 2026-10-06