DART-SD: Diamond-topology Aware Retrieval and Tuning for Self-Distillation of Multi-Turn Tool-Calling Agents
Hangrui Xu, Jiarui Wang, Yang Yang, Chuanbo Zhu, Fangda Chen, Ziqi Wu, Jingming Cai, Yan Song
cs.CL, cs.AI, cs.LG, cs.MA
2026-08-19
把可交换子目标建成钻石形状态图,只在学生第一次走出成功可达区之后做局部自蒸馏。Qwen3-8B五基准平均45.58,超过整段SFT的41.64。
多轮工具调用里,不少子目标顺序可换:先查天气再查航班,或者反过来,都能到同一个信息状态。把这些轨迹压成一条必须逐 token 模仿的线性示范,等于把一张钻石格压成一条路径。整段 SFT 会覆盖学生已经走对的探索;GRPO 一类结果奖励又把失败轨迹里的正确中间步一起罚掉。事后蒸馏多数仍把交互当成严格线性序列,分不清致命错误和无害绕路。
要压缩大教师到小工具模型,真正缺的是一张能表达「多条合法路径在中间状态交汇」的结构,而不是更长的示范。
DART-SD 先从教师 rollout 建 Interaction-State Transition Graph(ISTG)。节点不是瞬时动作,是累计交互状态 (It, Ut):I 是从工具返回里抽出的信息原子,U 是最近一次有效信息之后的无用操作。拿到新事实的是主节点,空转是辅助节点。顺序不同但信息集合相同的路径会在主节点重新汇合,钻石结构自然出现。无信息的报错、空结果被收成空集,避免把失败回包登记成新状态、把图撑爆。
学生失败轨迹按同一规则回放,投影到教师成功可达区。这个区域只保留成功轨迹上、离成功终点还在预算内的节点。Critical Topological Breakpoint(CTB)是投影还成立的最后一步,到投影失败的第一步。保留 CTB 之前的学生前缀,从锚点检索教师的成功与失败轨迹当特权上下文,生成恢复后缀。损失只打在 CTB 之后、最终答案之前的 assistant token 上。前缀、用户消息、工具观察、最终答案全部 mask 掉,避免把已经对的前缀再打一遍梯度。
这个循环做五轮:学生变强后 CTB 往后移,监督跟着能力边界走。教师是 Qwen3.6-27B 与 GLM-5.2 的混合池。学生是 Qwen3-4B 和 Qwen3-8B,在 FTRL 的 2215 个可验证任务上训练,每轮每任务 8 条轨迹,学习率 5×10^{-7}。主结果默认 no-thinking。
Qwen3-8B 五基准平均:Base 29.60,整段 SFT 41.64,FTRL-GRPO 40.33,DART-SD 45.58。域内 FTRL 的 Solve-F1:DART 45.66,SFT 41.89。4B 平均 39.17,也高于 SFT 的 37.62。论文写 8B 学生在 FTRL、ToolHop、τ-bench 上超过教师,尽管参数少一截。
不是每张表都赢。8B 的 BFCL Multi-Turn,FTRL-GRPO 是 35.25,DART 只有 27.63。4B 上同一项则是 DART 23.88 对 GRPO 13.50。平均分不能当全面胜利。
成功轨迹的平均工具调用从第 1 轮 4.23 降到第 5 轮 3.55,短于数据构造时的 golden 4.02。失败轨迹里 CTB 位置从 0.348 推到 1.452,说明会先把更长的前缀走对再出错。8B 在 FTRL 上的消融:自蒸馏把 Solve-F1 从 23.48 拉到 38.10,加 CTB 局部监督到 39.51,加渐进到 43.93,再换成 ISTG 投影到 45.66。通识侧 IFEval 从 34.75 到 45.29,MMLU 从 70.94 到 74.27,工具微调没有把通用能力打回去。
agent 蒸馏的损失不该均匀洒在整条轨迹上。可交换子目标是图,不是句子。只修第一次离开成功区的那一步,既保住探索多样性,又避免把已经对的前缀再打一遍。对要把 27B 级教师压到 4B 或 8B 工具模型的人,这比再堆一轮整段 SFT 更值得试。工具变少、前缀变长,说明学的是更短的可行路径,不是把教师轨迹背下来。
和 MatchTIR 那种在线性轨迹上做二分匹配再发回合奖励相比,这里连「轨迹是线性的」这个前提一起换掉。代价是必须先有一张教师图。
正文没有独立局限节。ISTG 依赖教师成功轨迹和一次语义原子标注:作者说标注错会倾向漏原子而不是捏造,漏了会让图变稀、投影变严。钻石假设针对顺序可换的子目标;强依赖的线性任务上,拓扑坍缩没那么严重,方法的增量会缩。8B 在 BFCL 上明显输给 GRPO,这项不能用平均分糊过去。训练绑定 FTRL 的可验证环境,真实 API 的脏返回、权限失败、用户插话没有同等压力测试。教师混了两个大模型,没有单教师对照。原子抽取本身要用模型看整题候选,图的质量跟这一步绑死,论文没有把标注误差单独测出来。