Datalab 实测:纯 RL 训练让 Agent 零死循环,SFT 循环率高达 92%
VikParuchuri · x · 2026-10-06
Datalab 为其文档 Agent 微调小模型(任务:科学 PDF 转 JATS XML,100 篇文章基准)时发现,agent 反复调用同一工具的死循环问题与训练方式强相关:SFT 模型在 temp 0 下循环率 92%,SFT 后再 RL 仍有 47%(29% 循环到回合上限),而仅用 RL 从基座训练则 0% 循环。作者认为关键在 on-policy 数据——on-policy distillation 的循环率也远低于 SFT。结论:RL 与 SFT 都能提升基准成绩,但只有 RL 能根治 looping,这对所有做 agent 后训练的团队有直接参考价值。
所属事件:Datalab 实验纯 RL 后训练根治智能体工具调用死循环(3 条相关)→
「编程与Agent」频道最新
- Reflection AI 开源 501B 智能体模型 Beam,23B 激活参数 — bigblueboo · 2026-10-06
- Grok Bot 官宣两周六场工作坊,覆盖营销、销售与编程场景 — XFreeze · 2026-10-06
- Nous Research 发 Agent 宣言:模型、记忆、运行环境都该由用户掌控 — NousResearch · 2026-10-06
- Linux 上完整安装 Google Antigravity 套件的教程 — CommunicationMean385 · 2026-10-06
- 实测20余种让廉价编码模型变强的方法:强模型「良心监督」性价比最高 — KangarooAnxious9394 · 2026-10-06
- 一周把所有仓库从就绪 Level 1 提到 Level 5 — matanSF · 2026-10-06