Salesforce 研究:只训练改变结果的那次工具调用,BFCL v4 提升 14 分

dair_ai · x · 2026-09-28

Salesforce AI Research 的多轮工具调用 RL 论文提出 Critical-State RL:当奖励取决于后续轮次时,奖励方差大多来自下游噪声,把奖励摊到整条轨迹上训练效率很低。

dairai 建议收藏,适合做多轮 agent RL 的人参考。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →