CentaurBench: Benchmarking LLM Capabilities on Augmenting vs. Automating Real-World Work Tasks
Pattaraphon Kenny Wongchamcharoen, Kris Gulati, Min Min Fong, Abhishek Nagaraj
cs.CY, cs.AI, cs.MA, econ.GN
2026-08-19
把10个模型放进7项工作任务,同时测自己交稿和给GPT-3.5当教练,两种排名相关仅0.48,5项冠军换人,仅GPT-5-Mini平均胜过无人辅导。
现有 LLM 榜单几乎全在问同一件事:模型自己把活干完,能打多少分。GDPval、JobBench 把职业场景做真了,评的仍是端到端自动化。经济学田野实验会测 AI 能不能帮人写得更快、客服接得更快,但通常只测一个模型、一个场景,对照是无人基线。
组织里更常见的用法是另一套。模型给计划、清单、自检步骤,真正交稿的是人,或者是更便宜的执行模型。会做题不等于会带人。CentaurBench 把自动化和辅导放到同一组任务上对打,看前者的排名能不能当后者的代理。
UC Berkeley Haas 的 DIAL 实验室选了 7 项有明确交付物的工作任务:菜单规划、东京旅行规划、天然气市场趋势简报、物流运筹备忘录、报税差错复核、咨询式回复、三年级辅导课段。任务主要来自 GDPval 和 Anthropic Economic Index,报税是作者自建的可核对规则题。
两条赛道并行。自动化赛道上,10 个模型各自直接交稿。辅导赛道上,每个候选模型只写一份辅导文本给固定工人 GPT-3.5-Turbo,工人再交稿。辅导文本被硬性限制成过程脚手架:需求核对、执行计划、终检清单,禁止代写交付物。变的是辅导质量,不是助手偷偷把活干了。
候选包括 Claude-Opus-4.8、Claude-Sonnet-4.6、Gemini-3.1-Pro、DeepSeek-V3.1、GPT-5-Mini、GPT-OSS-120B、GPT-O4-Mini、GPT-4.1、GPT-O3-Mini,加上工人 GPT-3.5-Turbo。辅导赛道另加一条 plain 基线:3.5 不看任何辅导,自己交稿。用 3.5 当工人,是因为它接近试点任务上的普通执行水平,也代表 multi-agent 里常被派去干活的便宜模型。
评分是盲测成对比较。4 个 LLM 评委(Claude-Opus-4.8、DeepSeek-V3.1、Gemini-3.1-Pro、GPT-4.1)用任务量规加通用量规打分,本家模型族回避。全流程独立跑 10 次,按胜率排秩再对秩取平均。自动化与辅导分开办锦标赛,两套产出从不直接对打。
这种辅导被故意做成保守下界:只教方法、不给答案,更接近教人做,不是替人做。数字只描述这一种脚手架,不能外推到代写草稿或当场改错。
自动化侧,GPT-5-Mini 平均秩最好,Claude-Opus-4.8 其次。GPT-5-Mini 在菜单、报税、旅行、辅导课四项拿第一;市场趋势是 Claude-Opus-4.8;咨询是 GPT-OSS-120B;运筹是 Gemini-3.1-Pro 与 GPT-OSS-120B 并列。GPT-3.5-Turbo 自己干,平均垫底。这是无工具、单轮、有界交付物上的排序,不能直接搬到带工具的 agent 榜。
辅导侧没有通吃的模型。GPT-4.1 咨询第一,GPT-O4-Mini 市场趋势第一,GPT-5-Mini 菜单和辅导课第一。运筹、报税、旅行三项上,无人辅导的 GPT-3.5-Turbo 压过所有带辅导条件。七项平均,plain 基线平均秩 3.79,只有 GPT-5-Mini 的辅导更好,3.66。
九个助手模型上,两种角色的 Spearman 秩相关只有 0.48,p=0.187,和零分不开。任务间差得更大:
| 任务 | Spearman ρ | p |
| 报税 | 0.85 | 0.004 |
| 菜单规划 | 0.64 | 0.066 |
| 辅导课 | 0.50 | 0.166 |
| 咨询 | 0.25 | 0.516 |
| 运筹 | 0.17 | 0.668 |
| 市场趋势 | 0.10 | 0.798 |
| 旅行规划 | -0.04 | 0.915 |
七项里五项自动化冠军与辅导冠军不是同一个。市场趋势上 Claude-Opus-4.8 自动化平均秩 2.05、辅导 8.15;咨询上 GPT-4.1 自动化 7.40、辅导 3.80。评委内部尚可对齐:6265 次至少两名合格评委的比较里,71.0% 选出同一赢家,自动化 74.5%、辅导 67.8%。评委选的赢家与自己量规均分一致的比例是 99.7%。
读辅导文本后,有效脚手架常见三条:在题目之外补分析步骤,把结构顺序写死,不要把工人带离交付物。差的辅导会复述题目约束、把结构扔回给工人,甚至明确禁止写任务要求的具体方案。没辅导经常打得过坏辅导。
选模型时「谁最强」问错了。该问的是这个角色、这个任务该用谁。交成品和当教练是两套能力,自动化榜只能当弱代理。
辅导可以是负的。九个更强模型给 3.5 写过程指导,七项平均只有一个条件赢过「让 3.5 自己想」。把更强模型塞进规划位,并不自动提高下游产出。
对要搭 multi-agent 或人机工作流的人,这篇给了一个可复用的测法:固定执行者,只换教练,用同一套任务和量规。代码和交互看板都公开。但别把现在的数字当采购表。工人固定为 GPT-3.5-Turbo,辅导是单轮过程脚手架,评委是 LLM。换工人、换多轮、换成给答案的辅导,排序可能全变。
作者自己划了几条:这是试点框架,不是能力地图;评委是 LLM,再多回避和复现也替代不了领域专家;辅导只有一轮、一个工人;任务只有七个。咨询、报税、辅导课、运筹尤其需要真人复核。
还有几处读下来站不太稳。相关 0.48 的 p=0.187,九个点撑不起「两种能力弱相关」的强结论,更稳的说法是「现有样本里对不上」。辅导协议故意不给内容,「辅导没用」只对这一种辅导成立。工人是 2023 年量级的 GPT-3.5-Turbo,对 2026 年的助手来说能力落差很大,辅导过载、执行走样会更严重。自动化赛道无工具,Opus 这类强在 agent 回路里的模型可能被压低。评委一致性 71%,辅导侧更低,排序对评委构成敏感。