SFT再RL仍会死循环:29%跑满轮次上限,on-policy数据才是关键
VikParuchuri · x · 2026-10-06
Datalab(Vik Paruchuri 团队)发布关于 agent 工具调用「循环打转」问题的复盘文章。他们指出 looping 现象并非首次被发现(Liquid AI 等也写过,apapiu 专门研究过文档 agent 中的 tool loop 及其 benchmark、SFT 与 RL 的交互)。
核心发现:
- SFT 之后再 RL 并不能解决循环问题:在 temperature 0 下,29% 的 SFT→RL 训练出的 agent 会循环直到轮次上限;而只用 RL 训练的这一比例为 0%。
- 关键变量似乎是 on-policy 数据:on-policy 蒸馏训练出的 agent 也远比 SFT 更少陷入循环。
结论对做 agent 训练的团队有直接参考价值:训练数据是否 on-policy,可能比「加一轮 RL」更能决定 agent 是否会卡死在工具调用循环里。
所属事件:Datalab 实验纯 RL 后训练根治智能体工具调用死循环(3 条相关)→
「编程与Agent」频道最新
- Grok Bot 官宣两周六场工作坊,覆盖营销、销售与编程场景 — XFreeze · 2026-10-06
- Nous Research 发 Agent 宣言:模型、记忆、运行环境都该由用户掌控 — NousResearch · 2026-10-06
- Linux 上完整安装 Google Antigravity 套件的教程 — CommunicationMean385 · 2026-10-06
- 实测20余种让廉价编码模型变强的方法:强模型「良心监督」性价比最高 — KangarooAnxious9394 · 2026-10-06
- 一周把所有仓库从就绪 Level 1 提到 Level 5 — matanSF · 2026-10-06
- 用 ChatGPT 设计六足机器人,仿真训练学会行走 — lavanyaai · 2026-10-06