多教师蒸馏的工具调用过量率被压到 9.0%
antgroup · hf · 2026-07-21
论文要点
这篇工作研究的是 agent 模型在多教师 on-policy 蒸馏中,为什么会学“过度调用工具”。作者发现,vanilla GKD 虽然能提升 tool-call recall,但也会把学生模型推向一种偏移:本来该直接回答的例子,也更容易去调用工具。
- 仅看整体 loss 不够,因为这种边界漂移在聚合指标里不明显。
- 作者把问题解释为 behavior leverage imbalance:像 <toolcall>、函数名这类处在模式切换入口的位置,会对最终生成模式产生不成比例的影响。
- 为此提出 Soft Clamp:在训练时对极端 token 级 Jensen-Shannon divergence 做动态压缩,但保留非零梯度。
实验结果
- 在 APIGen-MT 上,Soft Clamp 将过度调用率从 13.7% 降到 9.0%,同时保持决策准确率。
- 在 BFCL 多轮诊断 中,它也降低了 GKD 变体中的工具调用循环和重复调用。
核心结论是:多教师 OPD 不能只看 teacher 信号“有多大”,还要看它具体作用在生成的哪个位置。
「编程与Agent」频道最新
- Google 推出 Gemini 3.5 Flash Cyber,限量供政府和可信伙伴使用 — GoogleAI · 2026-07-22
- Cursor 将所有套餐额度翻倍,覆盖 Grok 和 Composer — XFreeze · 2026-07-22
- 视频版 proof of work 正变成编码智能体反馈层 — Vjeux · 2026-07-22
- Salesforce 将 MCP+ 开源,先过滤工具输出再进 agent 上下文 — msrivastav13 · 2026-07-22
- Anaconda 收购 Kilo Code,切入智能体软件开发 — anacondainc · 2026-07-22
- Poolside 的 laguna s 2.1 主打 118B MoE 和 100 万上下文 — ben_burtenshaw · 2026-07-22