EMNLP 论文 ToolLoop:分三阶段反向合成工具调用训练数据

jiqizhixin · x · 2026-09-29

工具调用让 LLM 能访问外部 API,但训练数据合成通常是「先生成后过滤」:模型一次性生成用户问题和工具调用,再由规则或模型筛选。问题在于格式校验难以捕捉单次生成中的畸形调用,且整条流水线优化的是最终通过率,而非真正的目标函数。

被 EMNLP 2026 主会接收的 ToolLoop 打破了这个循环:它把合成拆成三个阶段——目标函数采样、反向生成用户问题、正向生成工具调用——并在每个阶段引入动态自反馈。核心思路是用显式的中间结果约束后续生成,通过「生成-验证-修正」逐步对齐目标函数、用户意图与工具调用。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →