Salesforce 研究:只训练改变结果的那次工具调用,BFCL v4 提升 14 分
dair_ai · x · 2026-09-28
Salesforce AI Research 的多轮工具调用 RL 论文提出 Critical-State RL:当奖励取决于后续轮次时,奖励方差大多来自下游噪声,把奖励摊到整条轨迹上训练效率很低。
- 核心思路:用嵌套采样(nested sampling)把「当前动作引起的奖励变化」与下游噪声分离,只选出真正改变结果的那一次调用,用 contextual-bandit 更新训练它。
- 结果:在 BFCL v4 missing-function 任务上,训练被选中的那一轮可带来约 14 分提升;训练其他候选轮次则准确率持平甚至下降。
dairai 建议收藏,适合做多轮 agent RL 的人参考。
「编程与Agent」频道最新
- Base44 推出 Base Code:把现有代码库变成全团队的 AI 协作工作区 — omarsar0 · 2026-09-29
- 针对 AI 安全事件的沙箱+拦截方案已有落地实现:verifiers v1 — xeophon · 2026-09-29
- WebMCP 大爆发:Meta 眼镜、Shopify 结账、Cloudflare 一日齐上 — jeff_weinstein · 2026-09-29
- 零基础用 Claude Code 搭 AI Agent:从 CLAUDE.md 到 MCP 的 9 步路线图 — MaryamMiradi · 2026-09-29
- Zeeg 称 Paper 不兼容 WSL,征询结构化可视化设计 Agent 工作流 — zeeg · 2026-09-29
- OriginTrail DKG V10.0.19 上线:AI Agent 读图更快更省 CPU — melnykowycz · 2026-09-29