ToolLoop 三阶段闭环合成工具调用数据,BFCL 达 86.4%
机器之心 · wechat · 2026-09-20
vivo AI Lab 期间完成的研究 ToolLoop(EMNLP 2026 Main)提出将工具调用训练数据的合成拆分为三个阶段,并在各阶段引入动态自反馈,替代传统「先生成、再筛选」的一次性流程。
方法要点
- 候选函数构建:对函数描述做语义向量 K-means 聚类,组成有语义关联的候选集合,支持多工具选择与并行调用。
- 三阶段分解生成:① 采样目标函数组合(确定调用哪些函数及次数);② 反向生成用户问题(使意图与目标函数严格对应、包含必填参数信息);③ 正向生成带完整参数的结构化调用。
- 动态自反馈:每个阶段结合 LLM 语义判断、确定性规则与 AST 解析三类验证信号,失败后用「原始提示+失败输出+具体问题」组成新提示重试,每阶段最多 3 次,减少整条样本被直接丢弃。
实验结果
- 用 ToolLoop 构建了 11,024 条样本微调 Qwen3-4B-Instruct-2507,BFCL 单轮总体准确率 86.40%,高于 APIGen-4B(83.11%)与 ToolMind-4B(83.53%);ACEBench 上 72.1%。
- 消融实验:无反馈 79.97%、仅最终筛选 82.56%、完整 ToolLoop 86.40%,验证了过程中反馈修正的价值。
局限:目前验证依赖函数定义与模型判断,尚未接入真实 API 执行结果,多轮交互留作后续方向。
「研究」频道最新
- CV 大佬 Jitendra Malik:机器人弃用 3D 结构是在浪费宝贵信号 — JitendraMalikCV · 2026-09-21
- 用数据集定义生物学的千禧年难题:表位解析结合体目录 — owl_posting · 2026-09-21
- Gzip 与语法归纳能否补齐深度学习?作者称只用上了小脑 — ryunuck · 2026-09-21
- 研究者看好 Jev 带火 encoder 式结构化分类,单模型可解千类问题 — cwolferesearch · 2026-09-21
- 争鸣:激活函数与权重之下,LLM 难有真正的认知结构 — ryunuck · 2026-09-21
- ICLR 用 LLM 审稿体验:1-2 条有效意见配三页吹毛求疵 — Entrepreneur7962 · 2026-09-21