TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning
Changle Qu, Sunhao Dai, Hengyi Cai, Yuqi Zhou, Xinran Chen, Simon, Jun Xu
cs.CL, cs.AI
2026-08-05
TurnSight 提出 turn 级事后自蒸馏:从智能体自己执行的真实轨迹构造不同前瞻长度的教师视角,投票选出可靠方向去调节 RL 优势,只调幅度不调方向。Qwen3-8B 在三个 benchmark 整体均分 42.02,比最强基线 MatchTIR 高 7.7%。
让大模型用工具解决复杂问题(Tool-Integrated Reasoning,TIR)时,强化学习一直有个老大难:信用分配。一条轨迹跑完,只知道最后对不对,却不知道中间哪一次工具调用是有用的、哪次是多余甚至有害的。GRPO 这类基于结果的 RL,把一个轨迹级的优势(advantage)平均摊到所有动作上,等于把贡献差别很大的决定一视同仁。
已有的自蒸馏思路想给更密的信号,但教师分支的「特权上下文」通常来自标准答案或参考轨迹,和智能体实际走过的状态对不上。而且 token 级的监督打不到「一轮工具交互」这个结构,还会在同一轮里给互相矛盾的信用。TurnSight 想同时解决两件事:信号要密、要来自智能体真实走过的路,而且要按「轮」而不是按 token 打分。
TurnSight 是 turn 级的事后自蒸馏(turn-level hindsight self-distillation),思路可以这样拆:
一句话:它用智能体真实走过的路造监督,按轮给分,而且只调幅度不调方向。
在 Qwen3-4B 和 Qwen3-8B 上训练(FTRL 数据集 2215 题,RL 主干用 MatchTIR),在三个 benchmark 上评测:FTRL(域内)、BFCL 和 ToolHop(域外)。
| 方法(8B) | FTRL 均分 | BFCL 均分 | ToolHop | 整体均分 |
| MatchTIR(最强基线) | 42.78 | 33.78 | 40.54 | 39.03 |
| TurnSight | 46.92 | 37.56 | 41.58 | 42.02 |
8B 上整体均分从 39.03 提到 42.02(绝对 +3 个点,相对约 +7.7%),域外 BFCL 与 ToolHop 也涨,说明不是过拟合域内。4B 上整体均分从 34.76 到 37.51,同样领先。
消融(8B,FTRL 均分):去掉 turn 级聚合降到 43.23,去掉组归一降到 43.65,去掉多教师选择降到 45.62,三个组件都不可少。几个有意思的点:只看工具返回、不加标准答案,效果最好;固定单档前瞻里一步前瞻最强,前瞻越长越差;覆盖整条轨迹比只看前五轮(44.56)或后五轮(43.04)都好。
工具调用已经是 agent 的基本功,而大部分开源 RL 训练还停在「结果对就给奖励」的粒度。TurnSight 给了一个不依赖标准答案、只用智能体自身经验的密信号方案,工程上可直接接到 GRPO、MatchTIR 这类已有 pipeline 上(代码已开源)。它更像一个渐进但实在的改进:把信用从轨迹级细化到轮级,代价是要多跑几个带特权上下文的教师分支。对在做 agent 训练的人,值得拿去试自己的长程工具任务。