CAST把稀疏任务成败拆成逐步批判,4B的Retail pass^4到16.5%

CAST: Critique-Aware Supervision for Training Reliable Long-Horizon Tool-Calling Agents

Amir Saeidi, Zehua Zhang, Rishitosh Singh, Naman Ahuja, Vivek Gupta, Ali Payani, Gaowen Liu, Jayanth Srinivasa, Chitta Baral

EMNLP 2026 (Main)

cs.CL

2026-08-31

亚利桑那州立与思科把任务成败拆成逐步批判来训练工具agent:四B模型在零售任务上重复成功率从6.1%升到16.5%,超过三十二B基座。

这篇在解决什么

长程工具调用里,一次退错款、选错工具,就会把后面整段对话锁死。这种错不一定每次都出现,重复跑同一任务时才会冒出来,所以 τ-Bench 用 pass^k 看稳定性,不只看单次成功。现成做法两头不讨好:推理时再挂一堆反思 agent,延迟和 token 都贵;用轨迹级成败做 RFT 或 RL,又说不清是哪一步把任务弄砸的。提示出来的前沿 critic 更麻烦:它们偏悲观,把本来没问题的动作也拦下来,对话被拖进无用的改写循环。

CAST 要的是动作级、只用当前可见信息的核验,再把这种核验写进策略。

方法

三阶段。教师策略在同一批任务上重复 rollout,得到成功和失败轨迹。再由多 agent 核验给每一步打结构化理由和 0/1 标签,失败拆成幻觉、域规则冲突、工具用错三类。标注时教师可以看特权信息(例如标准轨迹),学生 critic 和上线策略看不到,只能用当时的局部上下文。

CAST-Critic 用理由生成损失加核验分类损失做监督微调。训练好的 critic 再去拦新交互:通过就执行,不通过就把理由交回策略改动作。只保留最终成功的、带批判痕迹的轨迹,用来 SFT 策略(CAST-Policy)。推理时可以 critic 和策略一起上,也可以只跑微调后的策略。

训练数据来自 τ-Bench Retail 的 500 题,每题 5 条轨迹,共 2500 条逐步标注。骨干是 Qwen3-4B 和 8B。Airline、Telecom、Telehealth 全程留作域外。

结果

Retail 域内,Policy-4B 相对 Base-4B:pass^1 从 7.2% 到 26.1%(+18.9),pass^4 从 6.1% 到 16.5%(+10.4)。相对只吃成功轨迹的 RFT-4B,pass^1 相当(26.1 vs 27.6),pass^4 高 4.3 个点。Policy-8B 相对 Base-8B:pass^1 14.1%→30.0%,pass^4 5.2%→14.8%;相对 RFT-8B 再高 2.4 / 2.6 个点。两个 Policy 的 pass^1 仍低于 Qwen3-32B-FC 的 35.0%,pass^4 却超过它的 13.1%(16.5% 和 14.8%)。

域外并不整齐。Airline 上单独的 Policy-8B 掉到 9.5% pass^1,加上 Critic-8B 回到 20.5%。Telecom 上 Policy-8B+Critic-8B 做到 38.9% / 27.8%,明显高于 Base-8B 的 31.9% / 5.6%。Telehealth 上 Policy-4B 的 pass^4 从 10.0% 到 30.0%。4B 配 4B critic 在 Retail 的 pass^4 从 16.5% 掉到 9.6%,小 critic 在域内会误伤。

把 Qwen3-32B 当 actor、换 critic:无 critic 平均 pass^4 11.5%;GPT-4.1、Qwen3-235B、Qwen2.5-72B 当 critic 分别降到 6.0%、3.4%、6.3%;CAST-Critic-4B / 8B 升到 15.9% / 19.5%。GPT-4.1 把 46.8% 的正确动作标成有问题,CAST-Critic-8B 只有 11.4%。相对 PALADIN,Critic-8B 在 pass^1 / 3 / 4 上高 20.9、15.3、14.9 个点;相对 EvoTool 高 2.6、4.5、4.3 个点。核验轮数不是越多越好:32B 在 3 轮、Policy-4B 在 4 轮达到各自最好的 pass^4。

为什么重要

对要上线客服或工具 agent 的人,这篇把「单次能做对」和「重复跑还稳」拆开了,并且说明轨迹级 RFT 抬 pass^1 够用,抬 pass^4 不够。小 critic 比把 GPT-4.1 塞进循环更校准,因为后者太爱拦。EMNLP 2026 主会的设定也清楚:零售域内训练,航空、电信、远程医疗做迁移。

4B 带 critic 在 Retail 上伤 pass^4,说明核验预算和 critic 校准必须一起调,不能默认「加一个审核就更稳」。

局限与存疑

作者写了两条:critic 和策略都是 SFT,没有在带批判的环境里做 on-policy RL;核验看的是当前动作是否合法,不显式建模它对后续状态的影响。另外,训练只在 Retail,Airline 上单独 Policy-8B 会掉点,迁移靠的是测试时再挂 critic。τ-Trait 的 Telecom / Telehealth 只有 18 和 20 题,pass^k 方差会偏大。GPT-OSS-120B 写在摘要里,主表没有对应行,这篇解读只用表里的数字。

术语

原文与代码

相关论文

全部论文解读