QuoteBench:匹配分可藏64分损伤,靠改写补偿才持平

QuoteBench: How Matched Scores Can Hide Command-Path Failures

Shangao Li, Yao Zhang, Volker Tresp, Yuanyuan Yang

cs.AI, cs.SE

2026-08-14

Stony Brook与LMU用56个一次性Bash任务拆开生成契约和执行通道;同一条回复再解析会掉55.4到73.2分,披露边界后六个配置能补回30.4到60.7分。

这篇在解决什么

写文件、改JSON、过SSH这类动作,失败经常出在引号、美元符、heredoc被下游再解析。现有终端和编码benchmark把命令构造、规划、重试缠在一起。命令生成benchmark又在固定通道上打分,看不出这条命令换个包装还能不能活。匹配成功率因此说不清:模型写错了,还是接口在生成之后把对的命令弄坏了。

方法

QuoteBench 56题,14个操作族,每族1条良性对照加3条危险载荷。验证器看最终字节、argv、JSON、目录或Git历史,不看退出码。失败执行里23.4%到47.0%退出码是0,状态却是错的。

两个生成契约。raw:直接吐Bash,当bash -c的脚本。disclosed-boundary:告诉模型回复会被嵌进 bash -c "R"。再加一个native:填厂商shell工具字段,抽出来仍走raw路径。执行通道:raw原样跑;nested故意加一层未转义的双引号解析,对应ssh host "..."、docker exec sh -c、CI run。六个公开agent系统的固定提交调查里两种契约都有。nested用真ssh localhost "R" 复现,八个配置里七个损伤到小数一致。

交叉设计固定任务、模型、验证器,把同一条raw回复分别走两条通道,得到运输损伤RN−RR;再把披露边界后新生成的回复放在nested上,得到补偿NN−RN。两者之和就是常规评测的匹配差距NN−RR。转义插值或改成临时脚本,能把所有448对公开回复的raw结果原样复现,所以披露条件下的恢复只能来自模型改写了生成。

结果

同一窗口八个配置,固定回复过nested,成功率掉55.4到73.2分。14条良性对照也会掉28.6到57.1分,因为日常命令里就有双引号活跃字符。

模型RRRNNN损伤补偿匹配差距
GPT-5.6-sol94.630.491.1−64.3+60.7−3.6
GPT-5.5100.028.689.3−71.4+60.7−10.7
Qwen3.5-27B85.730.430.4−55.40.0−55.4
Gemini-3.1-Flash-Lite78.619.614.3−58.9−5.4−64.3

GPT-5.6-sol的匹配分几乎持平,底下是64.3分被通道毁掉、60.7分靠改写补回来。Qwen和Flash-Lite补不回来。补偿不是泛化鲁棒:那批为nested改写的回复拿回raw通道,六个能补偿的模型会再掉28.6到64.3分。

最佳观测点上GPT-5.5、Opus-5、Fable-5对56题满分;其余从14.3%到98.2%。原生shell工具相对raw只差+2.6到−10.0分,远小于nested。前沿raw路径已经91.1%到100%,区分度全在nested。

排行会随路径翻转。RR和NN的Kendall相关0.57;GPT-5.6-sol在RR上落后Gemini-3.5-Flash一题,在NN上领先十八题。私有载荷上损伤和补偿的符号还在。effort几乎不抬nested回放通过率,最多在梯子内动5.4分;匹配分往上走时,多半是补偿在涨。

为什么重要

给发命令的agent打分,匹配成功率不是模型内禀属性。要报模型配置、生成契约、执行路径、工作点和终态验证器。通道损坏的修复很便宜:调用方在插值点转义,或改成临时脚本。正因为修复平凡,这篇的贡献是测量。能适应边界的模型和不能适应的模型,raw分看起来差不多。

局限与存疑

作者写得很清楚:只测一次性Bash的引号和插值,14个构造族不能外推到部署里这种边界有多常见。effort梯子每档只有一条存储生成,标签不是可比较的算力。native工具实验是观测性的。私有载荷没有难度匹配。typed操作只覆盖六个族。PowerShell、多轮修复、交互终端不在范围内。56题很小,单题就能推动排名。

术语

原文与代码

相关论文

全部论文解读