Datalab 实测:纯 RL 训练让 Agent 零死循环,SFT 循环率高达 92%

VikParuchuri · x · 2026-10-06

Datalab 为其文档 Agent 微调小模型(任务:科学 PDF 转 JATS XML,100 篇文章基准)时发现,agent 反复调用同一工具的死循环问题与训练方式强相关:SFT 模型在 temp 0 下循环率 92%,SFT 后再 RL 仍有 47%(29% 循环到回合上限),而仅用 RL 从基座训练则 0% 循环。作者认为关键在 on-policy 数据——on-policy distillation 的循环率也远低于 SFT。结论:RL 与 SFT 都能提升基准成绩,但只有 RL 能根治 looping,这对所有做 agent 后训练的团队有直接参考价值。

所属事件:Datalab 实验纯 RL 后训练根治智能体工具调用死循环(3 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →