多教师蒸馏的工具调用过量率被压到 9.0%
antgroup · hf · 2026-07-21
论文要点
这篇工作研究的是 agent 模型在多教师 on-policy 蒸馏中,为什么会学“过度调用工具”。作者发现,vanilla GKD 虽然能提升 tool-call recall,但也会把学生模型推向一种偏移:本来该直接回答的例子,也更容易去调用工具。
- 仅看整体 loss 不够,因为这种边界漂移在聚合指标里不明显。
- 作者把问题解释为 behavior leverage imbalance:像 <toolcall>、函数名这类处在模式切换入口的位置,会对最终生成模式产生不成比例的影响。
- 为此提出 Soft Clamp:在训练时对极端 token 级 Jensen-Shannon divergence 做动态压缩,但保留非零梯度。
实验结果
- 在 APIGen-MT 上,Soft Clamp 将过度调用率从 13.7% 降到 9.0%,同时保持决策准确率。
- 在 BFCL 多轮诊断 中,它也降低了 GKD 变体中的工具调用循环和重复调用。
核心结论是:多教师 OPD 不能只看 teacher 信号“有多大”,还要看它具体作用在生成的哪个位置。
「编程与Agent」频道最新
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- Anthropic 研究员:99% 工程师已跑 300+ 自改进 agent 群 — AlishaOutridge · 2026-09-11
- Gergely Orosz 观察:AI Agent 提速十倍交付,却带来一堆小退化 — ducha_aiki · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- Astra 分镜+Minimax H3 分镜逐帧生成,视频创作成功率大增 — Hailuo_AI · 2026-09-11
- Codex 用户实测:Sol 搭配 Astra/Luna 子代理更省额度 — pvncher · 2026-09-11