无验真奖励的长程agent训练:DRACO在AppWorld上比基座高15.9点,还超过有验真的GRPO

DRACO: Fine-Grained Credit Assignment with Dynamic Rubrics for Long-Horizon Agent Training

Shubham Gandhi, Saurabh Goyal, Kiran Kate, Yara Rizk

cs.AI, cs.LG, cs.SE

2026-09-04

DRACO 在看不到成败标签时按轨迹生成评分表,并把 GRPO 优势分到被引用的步骤。Qwen3.6-27B 在 AppWorldTN 上 TGC 从 69.4 升到 85.3,比有验真的 GRPO 还高 5.3 点。

这篇在解决什么

数学和代码能靠单元测试做 RLVR。客服、调研、跨应用操作往往没有可编程的成败判官,造一个判官几乎等于把任务再做一遍。常见退路是评分表:对整条轨迹打一个标量。长程 agent 动辄几十步,成功轨迹里有冗余和运气,失败轨迹里大部分步骤其实是对的。把同一个优势乘到每一个 token 上,统计上浪费,有时还在强化错误步骤。

CMU 和 IBM Research 把设定收得更死:训练全程不看任务成功,也不看金标准答案,奖励只来自过程标准。这比多数评分表论文更苛刻。AppWorld 上此前公开的 RL 结果,据他们说都碰过环境自带的单元测试。DRACO 是他们所知第一个全程不用这个信号的训练。

方法

两条互补的机制。

动态评分表。对每个任务先从指令提案标准,再对组内每条 rollout 补提案,合并去重后做成一组共享标准。判别式丢弃只保留「组里至少有人失败」的条款,避免人人都会的条款把奖励摊平。冻结的外部 judge(主实验是 GPT-5.4)对每条轨迹、每条标准给出通过/失败/不适用,并指出负责的步骤。轨迹奖励是 (通过数−失败数)/(通过数+失败数),按实际适用条款归一,不按条款总数。

步骤信用。GRPO 仍在组内标准化得到轨迹优势 Ai,但不再把 Ai 均匀乘到每个 token。judge 引用到的步骤得到质量 Q=通过/(通过+失败);Ai≥0 时权用 Q,Ai<0 时权用 1−Q,于是胜利轨迹强化被判为好的步骤,失败轨迹打压被判为坏的步骤。再按步骤 token 数把总推力摊开,使 Σ nj aj = Ai N,轨迹总推力守恒,符号也不翻。间隙 token(工具回显、连接词)零信用。闭环公式,不另训归因网络。

训练:AppWorld 训练切分 90 个任务,LoRA + GRPO,组大小 6,批量 16,8 张 H100。主策略 Qwen3.6-27B 训 100 步,Qwen2.5-32B-Instruct 训 75 步。τ-bench 只做零样本迁移。单元测试只用于评测。

结果

Qwen3.6-27B,AppWorldTN(168 题)TGC/SGC 从 69.4/41.1 到 85.3/70.6(+15.9/+29.5);更难的 AppWorldTC TGC 从 49.7 到 61.5。τ-bench 成功率 15.8→20.4。同一超参下,用单元测试当奖励的 GRPO 是 80.0/59.3,DRACO 仍高 5.3 TGC、11.3 SGC。一致性涨得比发现率更狠:TN 上 TGC 的 p3 从 47.6 到 72.8(+25.2),pass@3 只多 3.9。随机奖励只能到 74.0/50.0。

消融说明必须两件一起做。去掉动态表或步骤信用,p1 均分停在 52.0-53.3,完整 DRACO 是 55.7;p3 均分 35.3-37.8 对 40.9。TN 上,给逐轨迹评分表再加步骤信用值 +3.2 TGC、+5.7 SGC。TC 上更刺:固定评分表加步骤信用会在 p3 亏 3.7 TGC,换成逐轨迹表才变成 +1.4。信用规则需要足够具体的条款才能指认步骤。

Qwen2.5-32B-Instruct 上 TN 的 TGC/SGC 从 35.7/17.3 到 62.9/42.3,逼近有验真的 SALT(66.2/47.9)。回合数在 AppWorld 上缩短(TN 18.7→14.7),评测成本从 10.77 美元降到 8.27 美元。用策略模型自评、思考开启且 k=3 全过才算通过,TN 上 81.1/62.7,已经超过有验真基线;关掉思考、单次打分能把 100 步 judge 费用从 1607 美元降到 316 美元。自评偏松:6 万多条条款里与 GPT-5.4 一致 89.4%,把对方判失败的条款放过去 30.4%,把对方判通过的打回只有 1.3%。

为什么重要

客服和开放调研这类没有 oracle 的长程工具 agent,现在多半在等一个验真器,或把整条轨迹压成一个标量。DRACO 给出一条可跑的中间路:让 judge 写过程标准,再用闭式规则把分数送回步骤。它在 AppWorld 上能打过同预算的验真 GRPO,说明「看不到成败」不等于「学不动」,至少在这个基准上成立。自评变体还把前沿 judge 从推理环里拿掉,费用能降一个数量级。

局限与存疑

作者自己列的洞最大。评分表没有人类核对,内部自洽的 judge 仍可能系统性地错,训练会把偏见写进策略。步骤信用只靠终任务成绩验证,分对步骤也能涨分,分错步骤也可能涨分。判别式丢弃让条款集合随采样组变,训练方差没有单独测。主实验绑定 GPT-5.4,judge 质量下限不清楚。AppWorld 的工具空间相对干净,换到更开放的环境,动态评分表会不会被策略钻空子,这篇没有回答。

术语

原文与代码

相关论文

全部论文解读