无标准答案时六个LLM judge在难任务上全挤进77–82%

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling

Abhigya Verma, Amit Kumar Saha, Seganrasan Subramanian, Sai Harshitha Aluru

EMNLP 2026

cs.AI

2026-08-27

ServiceNow 用 3808 条 DAG 工具调用测 LLM 当评委的可靠度。难度升高,对齐单调下降,无标准答案时下降大约快 1.5 倍;难例上六个 judge 全挤进 77–82%。给参考轨迹后,Gemini-2.5-Pro 反而掉 3.9 个百分点。

这篇在解决什么

用 LLM 当评委已经从对话、摘要扩到了 agent 的工具调用:选对函数、填对参数、按依赖顺序执行、覆盖用户意图。对话评测里的偏见研究很多,工具调用这边大多只报一个总通过率和一小段人工一致率,难度、拓扑、有没有标准轨迹都不拆开看。

ServiceNow 的 AgentJudgeBench 把问题换成:judge 在结构化、带依赖的工作流上到底稳不稳。正确与否不是文笔偏好,四类错误可以互相拆开,一条计划在选工具上对、在顺序上仍可能错。没有标准执行轨迹时(线上常见情况),judge 只能从用户问题和工具 schema 反推对错,难得多。

方法

数据是合成的 BFCL 风格记录,共 3808 条,覆盖 15 个企业域、每条 8–19 个工具。六种 DAG 拓扑:线性、扇出、扇入、菱形、可选增强、类循环。同一条任务改写成 easy / medium / hard,标准轨迹保持不变,只加查询歧义。改写校验里,medium→hard 有 93.9% 的记录得到一致认可;easy→medium 只有 58.1%,medium 更像复述稳健性检查,不是校准过的中间档。

五个 generator(SmolLM3-3B 到 Llama-3.3-70B,外加 GPT-5.4)产出工具调用。程序化 judge 按规则打四个分:工具选择、参数结构、顺序、查询覆盖,取值连续落在 0 到 1。六个 LLM judge(GPT-OSS-20B、QwQ-32B、GPT-OSS-120B、Claude Sonnet 4.5、Gemini-2.5-Pro、GPT-5.4)在「给标准轨迹 / 不给」两种提示下,用 {0, 0.5, 1} 打同样四维。对齐分数是 1 减去与程序分的绝对差。全因子 90 个格子,有效评估 321648 次。另加 Prometheus-2 作专职 judge 基线,不计入六模型统计。

120 条 hard 样本的单标注人研究用来校准程序分:四维里有三维与人的一致率在 92.5–98.3%,参数结构只有 82.5%,因为程序会罚掉 schema 合法的多余键,人可以接受。

结果

30 组 generator×judge 在两种条件下都随难度单调下降;不给标准轨迹时,下降幅度大约是给轨迹时的 1.5 倍。难例、无轨迹时,六个 judge 在五个 generator 里的四个上挤进 77–82%,和模型规模几乎无关。

给标准轨迹并不总是好事。QwQ-32B、GPT-OSS-120B 的对齐会升;GPT-5.4 掉 1.5 个百分点,Gemini-2.5-Pro 掉 3.9 个百分点,bootstrap 区间不重叠。效应集中在顺序维:前沿模型锚定参考轨迹的排列,把功能等价但结构不同的序列判错。把参考换成另一条记录的错误轨迹后,Gemini 的对齐和正确轨迹时一样,QwQ 则贴近「不给轨迹」的分数,差在 0.2 个百分点以内。

条件难度最优 judge第二名
无轨迹EasyGemini-2.5-Pro 92.1%GPT-5.4 92.0%
无轨迹HardGPT-5.4 79.7%Gemini-2.5-Pro 78.8%
有轨迹EasyQwQ-32B 94.0%GPT-OSS-120B 93.0%
有轨迹HardQwQ-32B 83.4%GPT-OSS-120B 83.2%

Llama-3.3-70B 上,QwQ 在 easy 有轨迹时对齐 96.6%,hard 有轨迹 87.5%、无轨迹 84.4%。温度在 0.3/0.7/1.0 上最大散度 0.6 个百分点;第二组配对只有 0.25。CoT 开关 24 个格子,有轨迹均差 +0.11,单格不超过 0.3。结构化分项 rubric 相对自由文本,在 Qwen3-32B 评 Llama-3.3-70B 时加 4.8–6.5 个百分点,是测过的配置里最大的杠杆;换到 QwQ 评 SmolLM3-3B,easy 仍加 3.9、medium 加 2.4,hard 反过来低 0.8。judge 之间有轨迹时精确一致 79.1%(κ=0.419),无轨迹 92.6%(κ=0.559),后者是提示把分数压扁,不是真共识。六模型软投票在 hard 有轨迹时 82.5%,不超过最好的单个 judge。Prometheus-2 低 20–30 个百分点,和其他 judge 的 κ 只有 0.01–0.07。

无轨迹难例的上限,有一部分来自提示默认打 1.0。改成默认 0.5 后,三个强 generator 最多升 1.0 个百分点,Llama-3.1-8B 升 4.1,SmolLM3-3B 升 5.6。对能打的 generator,天花板主要是任务难度;对弱 generator,提示过宽会给错输出送分。拓扑上扇出最好做,类循环和扇入最难。

为什么重要

线上多数时候没有标准轨迹。这时换更大的 judge 几乎买不到差距:难例上大家挤在同一条带子里。有轨迹时,QwQ-32B 最贴程序分,人工校准里 GPT-OSS-120B 更贴人;无轨迹时 Gemini 和 GPT-5.4 只以大约 1 个百分点领先。配置上,别把希望放在升温度或开 thinking,先改分项 rubric,并且按 judge×generator 配对复核,hard 上方向可能反转。

专职文本 judge(Prometheus-2)在这套结构分数上几乎不可用。六个通用模型的失败还高度相关,投票补不了盲区。

局限与存疑

数据是合成的,不是企业日志,域漂移仍在。easy→medium 改写只有 58.1% 被一致认为变难了,主证据应看 medium→hard。程序分在多余参数上比人严,绝对数字带着这条规则;人侧是单标注,QwQ 在「最贴人」排名上会从第一掉到第四。

GPT-5.4 同时当 generator、judge 和改写元评委,且是不可复现的 Azure 快照;它评自己的顺序维偏差 +0.172,其他 generator 上不超过 +0.008。主结论在开源 generator 上能单独成立。评测停在评估时,没有测这些失效会不会变成奖励模型或选模型门的训练信号。

术语

原文与代码

相关论文

全部论文解读