ClawProBench: Trace-Aware Evaluation of AI Agents with Runtime Coverage and Frozen Workplace-Style Holdouts
YuanHang Xiao
cs.AI
2026-08-24
港中文提出轨迹感知基准ClawProBench,评的是模型加运行时整捆配置。102场景全画像最高分0.7671,原生面0.52低于工作区0.64;冻结holdout上一次过关66%,三次全过只剩29%。
Agent 榜单大多只看最终答案对不对。模型已经跑在带文件、浏览器、记忆、定时任务和子代理的运行时里,失败可以出在取证、路由、安全边界,也可以是三次里撞上一次。只报终态,分不清是模型不行还是这套声明过的配置不行。
港中文的 ClawProBench 把评测对象改成「模型 + 运行时」整捆配置,在 OpenClaw 上落地,并把执行轨迹留作审计材料。
两条赛道。全画像 102 个活场景:66 个工作区任务,36 个打在 OpenClaw 的 8 个原生面上(skills、browser、memory、message、sessions、directory、cron、子代理)。难度刻意偏硬,91/102 标成 hard/expert,覆盖约束、恢复、规划、安全、综合、工具六个维。冻结 holdout 是 68 个工作区风格、封闭世界 JSON 任务,选择器 realistic-holdout-68-20260511 锁死场景身份和检查器接口,用来测三次重复可靠性和跨运行时对照。那 36 道原生题不声称换个工具名就能移植。
每题跑 3 次。单次轨迹分是
S = Gsafety × (0.65 C + 0.35 P) × (1−E)
C 是终态和产物正确率,P 是过程分(该用的工具集合、有序子序列、冗余控制或自定义量表),E 罚多余工具调用,Gsafety 按严重程度一票否决。过程分上限 0.35,答案全对、过程全空最多拿 0.65。总分先题内三次平均,再按难度权重 1/2/4/8 和维度权重汇总(工具和规划各 0.20,其余各 0.15)。榜上的 Final 还会掺 pass@k-all 和 pass@k-any。
跨运行时有一份适配合同:场景身份、新鲜工作区、规范化轨迹字段、安全标签、同一套检查器。IronClaw 和 NanoClaw 只在 holdout 上比,全画像仍是 OpenClaw 专属。
全画像 68 条配置,holdout 37 条干净记录。最高 safety-gated 均分 0.7671,前五名只差 0.0661,没有顶格。原生面均值 0.5238,工作区 0.6415,按难度和维度分层后差距仍大于 0.10。
九个公开模型的诊断面板:
| 模型 | Final | Avg | Pass³ | Pass@3 |
| GPT-5.5 | 0.679 | 0.693 | 0.627 | 0.687 |
| MiMo-V2.5-Pro | 0.633 | 0.685 | 0.465 | 0.625 |
| GLM-5.1 | 0.629 | 0.690 | 0.449 | 0.616 |
| Claude Sonnet 4.6 | 0.605 | 0.666 | 0.455 | 0.539 |
| Gemini-3.1-Pro | 0.540 | 0.581 | 0.300 | 0.546 |
Holdout 上 pass@k-any 均值 0.6638,三次全过只有 0.2890。全画像和 holdout 的 29 模型 Spearman 是 0.1754,bootstrap 区间 [-0.23, 0.54],排不出稳定名次。纯正确率和综合分 Spearman 0.8060,最大名次挪 46 位。
运行时版本不是记账字段。4 个模型 × 4 个 OpenClaw 版本(2026.3.24 到 2026.6.11),3264 次试验状态全成功,同模型分差最大约 0.052,严格 3/3 最多差 10/68(14.7 个百分点)。再换成 OpenClaw v2026.6.11、IronClaw、NanoClaw,2448 次同样全成功;qwen3.6-plus 分差 0.0716,deepseek-v4-flash 严格通过差 13/68(19.1 个百分点)。没有一个 harness 通吃:Kimi 和 GLM 在 NanoClaw 最高,Qwen 在 IronClaw 最高。
失败类型主要是精确约束、缺证据、审批或时间边界、运行时路由。这是检查器失败明细自动归堆,当审计线索用,不是人工分类学。
对做 Agent 产品的人,这条基准在说一件很具体的事:榜上的模型名不够,要绑模型端点、运行时版本、适配器、超时重试和执行状态。一次做对和每次做对差一倍以上。原生面比文件工作区更难,只测工作区会把路由问题藏起来。
它不是又一个「更真实的 workplace 套件」。贡献是把覆盖、过程分、安全门、状态和跨运行时合同放进同一次诊断。WildClawBench 已经在 OpenClaw 上做活评测,ClawProBench 的差异在联合诊断,不在「第一次上线」。
测的是配置,不是脱离 harness 的模型智力。三 harness 对照没有拆开 wrapper、路由、schema、安全层各自贡献多少。原生全画像仍绑定 OpenClaw;跨运行时只有 4 个模型身份。Holdout 是校准后冻结的公开集,不是永久隐藏的私有集,过拟合风险作者自己写了。原生和工作区的差距做了分层,检查器密度和输出格式仍可能不同,论文不声称因果。全画像–holdout 相关区间穿过 0,不能拿来讲比「两条榜排法不稳定」更强的结论。
安全、凭据、注入类场景是合成数据。分数是研究诊断,不是上线许可。