EMNLP 论文 ToolLoop:分三阶段反向合成工具调用训练数据
jiqizhixin · x · 2026-09-29
工具调用让 LLM 能访问外部 API,但训练数据合成通常是「先生成后过滤」:模型一次性生成用户问题和工具调用,再由规则或模型筛选。问题在于格式校验难以捕捉单次生成中的畸形调用,且整条流水线优化的是最终通过率,而非真正的目标函数。
被 EMNLP 2026 主会接收的 ToolLoop 打破了这个循环:它把合成拆成三个阶段——目标函数采样、反向生成用户问题、正向生成工具调用——并在每个阶段引入动态自反馈。核心思路是用显式的中间结果约束后续生成,通过「生成-验证-修正」逐步对齐目标函数、用户意图与工具调用。
「模型」频道最新
- Claude Code 里 Opus 5.5 依旧像不限量,OpenAI Dev Day 面临降价压力 — Angaisb_ · 2026-09-29
- 曝 OpenAI 正开发 ChatGPT Pro Max 套餐,DevDay 前夜 stir 订阅涨价猜想 — scaling01 · 2026-09-29
- Sonnet 5.5 一条 prompt 一键复刻月入 10 万美元的应用 — PrajwalTomar_ · 2026-09-29
- Bindu Reddy 爆料:OpenAI 明天可能不会发布新模型 — bindureddy · 2026-09-29
- 补贴时代终结:ChatGPT Pro 200 美元档用量砍半,新推 500 美元档 — Norwood_Reaper_ · 2026-09-29
- 博主研究 Opus 5.5 模型行为:用它写出完美的 HyperFrames 视频 — toolstelegraph · 2026-09-29