单干跑分第一的 agent 协作垫底:斯坦福用 93 个真人重排 AI 搭档榜

CollabSkill: Evaluating Human-Agent Collaboration On Real-World Tasks

Yijia Shao, Zora Zhiruo Wang, Neel Ahuja, Yicheng Wang, Bowen Liu, Diyi Yang

COLM 2026

cs.HC, cs.AI, cs.CY

2026-04-20

用 93 个真人、386 次真实工作评 AI agent 协作,发现单干最强的 Gemini CLI 协作垫底,Claude Code 反超 Codex,决定协作水平的是实操经验不是态度。

这篇在解决什么

评 AI agent 有个明显的盲区:几乎所有 benchmark 都让 agent 单干。SWE-bench 让它独自修 bug,GDPval 让它独自做表格,跑分高的就是赢家。但真实工作里 agent 很少单干,它和一个人配对,人下指令、补漏、纠偏。单干能力强,不代表搭伙能力强。

更难的是人跟人差别极大。同一段提示,老手和新手交给同一个 agent,结果可能天差地别。直接拿平均分给 agent 排名会被人的差异污染:一个 agent 分低,可能是它配到的人差,不是它自己差。以前的协作研究要么用 LLM 模拟用户(太配合、风格统一、没有真实的烦躁),要么任务太简单,够不着真实职业场景。

方法

CollabSkill 做了三件事。

第一,攒真实数据。作者从 GDPVal、APEX、APEX-Agents 三个数据集里挑任务,覆盖 ONET 二十个行业大类里的十个,通过 Upwork 招了 93 个美国工人,平均从业 9.6 年。每个工人按职业背景随机配一个 agent,在本地干活,交成品和交互日志。最后拿到 386 个工作 session、1500 多条提示,单次中位时长 76.7 分钟。

第二,把成品打分。两阶段自动评分器:先生成评分细则(rubric),再用多个 LLM 当评委照着细则打分。

第三,也是核心,用贝叶斯评分系统把人和 agent 的贡献拆开。它把每次协作结果建模成 agent 技能加人的技能再加噪声:y = sA + sH + ε。每方都给一个高斯先验,来一条新数据就用卡尔曼滤波更新后验。最终分数取 μ - 3σ,即均值扣掉三倍标准差,刻意压低不确定性大的对象,这是 TrueSkill 那套保守评分的思路。这样排名只反映 agent 本身的协作能力,不被配到的人拖累或抬举。

结果

排名和单干榜几乎反过来。

AgentCollabSkill 协作分单干分SWE-bench Verified
Claude Cowork76.738n/an/a
Claude Code74.77877.1771.40
Codex71.26778.0272.80
Manus71.204n/an/a
Gemini CLI69.55579.4469.60

单干榜上 Gemini CLI 最高(79.44),Codex 次之,Claude Code 最低;协作榜上 Gemini CLI 垫底。把比较限缩在三个同属终端界面的 agent(Claude Code、Codex、Gemini CLI)里做同等对照,Claude Code 第一,Codex 落到第三,Claude Code 强过 Codex 的概率超过 0.999。这条和 SWE-bench、GDPval、SciCode 这些公认榜单全反过来,那些榜单里 Codex 一致领先 Claude Code。

界面设计也单独起作用:Claude Cowork 和 Claude Code 用同一个 Claude 模型,差别只是前者是给非开发者的桌面图形界面,后者是终端。就这点差别,Cowork 稳高于 Code(p > 0.999)。

人这边,结论很干脆:决定协作水平的是实操经验,不是态度。自报的 LLM 熟悉度和协作技能正相关(Spearman ρ = 0.297,p = 0.010),乐意把活交给 agent 也正相关(ρ = 0.238,p = 0.041),其余态度项都不显著。能力分层很明显:把人按协作技能分四档,最高档(Q4)对单干基线的胜率 74%,最低档(Q1)只有 27%。一次协作下来,人对 agent 的信任和放权意愿都涨了(信任 Δ = 0.58,p = 0.004),对「该给 agent 多大自主权」的判断也往多给的方向调(Δ = −0.50,p < 0.001),但他们自己想要多大自主权没变(p = 0.105,不显著)。

为什么重要

对从业者的直接提醒:选 agent 别只看单干榜单。一个独自跑分最高的 agent,配到真实工作流里可能掉到末位。如果团队主力是非开发者,带 GUI 的 agent(如 Cowork)比裸终端更值。对人来说,多上手比改态度管用,这条对培训和组织落地都有指向。

更根本的是它给了一个方法范式:只要把人和 agent 的技能显式建模、分开估计,就能在「人差异巨大」的前提下给出可信的 agent 排名。以前不是不能评协作,是没法把人的噪声去掉。

局限与存疑

样本有明显偏向。93 人全是 Upwork 上的美国工人,只覆盖 10 个行业大类,做不了细粒度的子群分析。评分靠 LLM 评委,没用人力评(作者说人力评太贵),评委本身的偏差没完全排除。模型把协作结果拆成 agent 技能加人技能,没再细分「任务本身的技能」和「与人协作的技能」,所以一个任务强但不会配合的 agent 会被混进同一个数里。另外 9.6 年的平均经验偏高,可能高估了普通工人的协作水平。

术语

原文与代码

社区讨论

相关论文

全部论文解读