Berkeley 联合 250 位专家出题:ALE 最难档 agent 平均通过率不足 1%

Agents' Last Exam

Yiyou Sun, Xinyang Han, Weichen Zhang, Yuanbo Pang, Tianyu Wang, Yuhan Cao, Yixiao Huang, Chris Duroiu, Haoyun Zhang, Jeffrey Lin, Weishu Zhang, Tyler Zeng, Ying Yan, Bo Liu, Hanson Wen, Mingyang Xu, Xiaoyuan Liu, Zimeng Chen, Weiyan Shi, Amanda Dsouza, Vincent Sunn Chen, Patrick Bryant, Carl Boettiger, Yamini Rangan, Bradley Rothenberg, Kyle Steinfeld, Arvind Rao, Tapio Schneider, Georgios Yannakakis, Laure Zanna, Kaan Ozbay, Ida Sim, Tarek Zohdi, George Em Karniadakis, Jack Gallant, Teresa Head-Gordon, Yushan Li, Wenxi Deng, Tao Sun, Huiqi Wang, Zhun Wang, Justin Xu, Chris Yuhao Liu, Yafei Cheng, Rongwang Hu, Aras Bacho, Shengcao Cao, Zengyi Qin, Yixiong Chen, Hengduan Fan, Hao Liu, Lin Zeng, Shashank Muralidhar Bharadwaj, Litian Gong, Yingxuan Yang, Maojia Song, Ruheng Wang, Zongzheng Zhang, Honglin Bao, Shuo Lu, Jianhong Tu, Zhonghua Wang, Zheng Zhang, Zijiao Chen, Yanqiong Jiang, Zhendong Li, Bohan Lyu, Chang Ma, Peiran Xu, Benran Zhang, Shangding Gu, Haoyue Hua, Haoyang Li, Wanzhe Liao, Chengzhi Liu, Junbo Peng, Haoran Sun, Zechen Xu, Bo Chen, Jiayi Cheng, Yi Jiang, Keying Kuang, Yuan Li, Youbang Pan, Ziyan Rao, Alexander Schubert, Yifan Shen, Vincent Siu, Xiatao Sun, Kangqi Zhang, Xiaopan Zhang, Yuchen Zhu, Ishaan Singh Chandok, Lei Ding, Jingxuan Fan, Andrew Glover, Jiaming Hu, Yiran Hu, Wenbo Huang, Zixin Jiang, Haoran Jin, Lukas Kim, Ming Liu, Yang Liu, Alireza Rafiei, Xuhuan Shen, Kunyang Sun, Sophia Sun, Ting Sun, Eric Wang, Yixin Wang, Hanwen Xing, Sihan Xu, Yuzheng Xu, Zhongxing Xu, Zhiling Yan, Boqin Yuan, Ruiqi Zhang, Yifan Zhang, Zibo Zhao, Liana, Santanu Bosu Antu, Haoyue Bai, Carlo Bosio, Joseph Cavanagh, Patricia Cavazos-Rehg, Tianxing Chen, Xuewen Chen, Yipu Chen, Chenyu Zhu, Chen Dai, Stefano De Castro, Yunfu Deng, Kaustubh Dhole, Jiayuan Ding, Chenchen Du, Zhehang Du, Hao Fan, Run-Ze Fan, Hengyu Fu, Shi Gu, Yifan Gu, Charlie Guo, Baihe Huang, Baixiang Huang, Rimika Jaiswal, Zhihan Jiang, Ran Jin, Erin Kasson, Xin Lan, Joseph Lee, Deren Lei, Chenyu Li, Daofeng Li, Haitao Li, Hongwei Li, Jingyan Li, Xiao Li, Yi Li, Yinsheng Li, Yuangang Li, Zhixu Li, Wenyu Liang, Longtai Liao, Kevin Qinghong Lin, Andy Zeyi Liu, Che Liu, Jiaming Liu, Kaiyuan Liu, Xuan Liu, Pan Lu, Wenbo Lv, Yicheng Lyu, Qiuyang Mang, Kyle Montgomery, Yuzhou Nie, Ruoxi Ning, Jorin Overwiening, Xu Pan, Layna Paraboschi, Core Francisco Park, Justin Purnomo, Swati Rajwal, Scott Rankin, Bixuan Ren, Yiren Rong, HaoYang Shang, Ventus Shaw, Fiona Shen, Jiawei Shen, Minqi Shi, Shi Qiu, Huaxiu Yao, Tianneng Shi, Jonah So, Vladislav Susoy, Hannah Szlyk, Haocheng Wang, Jialu Wang, Wei Wang, Xinyu Wang, Zehao Wang, Dowling Wong, Angela Wu, Dehao Wu, Fangyu Wu, Mengyuan "Millie" Wu, Yu Wu, Yuchen Wu, Yuhao Wu, Qingpo Wuwu, Weihang Xiao, Yongyi Xiong, Fan Xu, Ruiling Xu, Mingxuan Yan, Benjamin Yang, Jirong Yang, Sen Yang, Xiaoli Yang, Yushi Yang, Haoran Ye, Xiaohu Yu, Zhengming Yu, Chenlong Zhang, Chi Zhang, Hanning Zhang, Hanwen Zhang, Junge Zhang, Kunpeng Zhang, Song Zhang, Wenjin Zhang, Wenshuo Zhang, Ying Zhang, Yizhi Zhang, Brian Zhao, Qijian Zhao, Yimin Zhao, Yuhaohua Zheng, Liwei Zhou, Tianyue Zhou, Sichen Zhu, Siqi Zhu, Yan Zhu, Yishu Zhu, Jierui Zuo, Chonghao Cai, Helena Casademunt, Wenjia Chen, Cheng Cheng, Nawen Deng, Rao Fu, Tianfu Fu, Yifan Han, He Ren, Zhenyu He, Qiao Jin, Langlang Li, Yuetai Li, Sylvia Liu, Lu Lu, Luqing Zhou, Subhabrata Mukherjee, Yunqi Ouyang, Yin Ren, Dawei Shi, Haoran Wu, Zhiyue Wu, Hannah Yao, Zhuoran Yi, Jenny Yu, Rhea Zhan, Hang Zhou, Blake Zhu, Junfan Zhu, Alan Yuille, Yang Liu, Russell Alan Poldrack, Jiachen Li, Zhenglu Li, Molei Tao, Jing Huang, Wenqi Shi, Costas Spanos, Lichao Sun, Chenguang Wang, Orson Xu, Zhen Dong, Hector Gomez, Aylin Caliskan, Ali Emami, Haimin Hu, Zhi Li, Lihui Liu, Murphy Niu, Yi Shao, Jianxin Sun, Mikko Tolonen, Ting Wang, Sanjiv Das, Yanjun Gao, Wenbo Guo, Erika J Schneider, Zhiyong Lu, Yian Ma, Mark Mueller, Radha Poovendran, Somayeh Sojoudi, Yinglun Zhu, Dawn Song

cs.AI, cs.CL, cs.LG

2026-06-04

UC Berkeley 联合 250 多位专家构建 ALE 基准:1490 个真实职业工作流任务,最强 agent 在最难一档通过率不足 1%。

这篇在解决什么

围棋、奥数、竞赛编程,benchmark 一个接一个被清场,核心行业里的可测量变化却没跟上。ALE 把这归为评测问题:现有基准缺少对「真实、有经济价值、长程工作流」的持续测量。这件事值得较真,领域的注意力跟着 benchmark 走,ImageNet 之于计算机视觉就是先例;一个领域一旦有了可验证的公开评测,进步和落地都会加速。

做这样的评测有三个结构性障碍。长程真实工作流收集成本高,既有基准只好退到更短的 computer-use 任务、合成环境或纯问答。行业广覆盖需要持续接触各领域专家,多数团队没有这个渠道。验证也难,真实交付物是异构的,可能是刀路文件、财务表格、3D 网格或游戏存档,所以最接近的两个先行者 GDPval 和 Remote Labor Index 都靠人工判分,贵且难规模化。结果是现有基准在真实性、广度、可验证性上各丢一角。把 16 个已有 benchmark 映射到统一的 55 子领域坐标系后,它们的并集仍留下 13 个子领域零覆盖,GDPval 覆盖 16/55,RLI 14/55。

方法

任务不是编出来的,是行业专家把自己交付过的项目上传上来的,这些工作当年花了他们几天到几周。每条任务过五道门:顾问委员会定向招募;提交门户配合 AI 辅助工具,把提案补到五个要素齐备(任务描述、输入文件、目标软件、期望交付物、评测方案);初审用会议评审式档位(大修、小修、borderline、accept、strong accept);工程团队容器化并做 dry-run;最后专家委员会同行评审,专门校准评分边界既不过窄也不过宽。外部提交 960 份、团队自制 530 份,合计 1,490 个任务实例。领域划分锚定 SOC 2018 / ONET(美国劳工部的职业分类体系),55 个子领域归入 13 个行业大类,另补 4 个 SOC 尚未收录的前沿子领域。

运行时三者解耦:任务规格是可执行的 main.py,暴露 load()、start()、evaluate() 三个生命周期函数;agent(harness 加模型)只拿到任务描述和元数据;环境是一台远程虚拟机,input 只读、software 预装、output 是 agent 唯一可写区、reference 藏着真值只供评分。任何符合动作接口的 agent 可以跑任何任务。

评分是设计重心。比较形式从精确哈希、带容差的数值表格、几何距离到行为世界状态;组合上最常用 gate-and-score,先过一道二值硬门(「刀路无碰撞」「文件能解析」),门没过,质量分再高也是 0。原则是有确定性替代就不请 LLM 当裁判;确实需要视觉判定的少数任务,只用锚定证据的是非探针,不做整体印象式打分。

评测对象被明确为一类 agent:GCUA,五层能力(Brain、Eyes、Body、Hands、Feet)齐备的通用 computer-use agent。CLI agent 缺 Eyes,GUI agent 的编排和工具面浅。主流评测走 GUI-as-Tool 模式,14 个桌面操作经 MCP 桥接成普通工具,同一个模型在一个循环里同时处理 shell 输出和截图。防污染上只公开约 10%(150 个),其余私有并定期轮换。

结果

主结果跑在公开集上,每次运行上限 5 小时,总超时率 3.8%。

配置Near-Term 通过率Last-Exam 通过率Overall
Codex (GPT-5.5)38.1%0.0%24.0%
ALE-Claw (GPT-5.5)32.8%2.6%23.0%
Claude Code (Fable 5)34.3%0.0%22.0%
Claude Code (Opus 4.7)20.9%0.0%13.2%

最直观的参照是 Terminal-Bench:Codex 配 GPT-5.5 在那里拿 82%,换到 ALE 的 Linux 子集 ALE-CLI 上整体 23.3%,最难档 0%。全部配置在最难档的平均通过率不足 1%,基准名字里的「Last Exam」由此而来。三档分工明确:Near-Term 67 个任务、头部 38.1%,是短期内能竞争的档;Full-Spectrum 55 个,保证每个子领域至少一个实例;Last-Exam 38 个,多数 agent 直接 0%。团队还裁了个参考 harness ALE-Claw,用基础组件就拿到接近主流 harness 的分数。

失败归因最有信息量。Claude Code 加 Opus 4.7 的失败任务里,Understanding 和 Approach 两类合计约四分之三,瓶颈在领域知识不在执行;缺乏专业知识的 agent 绕开目标行业软件,自己写临时脚本凑结果。工具统计印证:34% 的任务指定图形软件为主工具,多数配置里 GUI 调用占比却很小,agent 拿 Bash 替代。域间差异大,计算数学、农业环境类 55–85% 最高,教育类低于 25%。性能差异分解后,模型选择的影响约是 harness 选择的 3 倍。成本上,单任务单次 3 到 10 美元、几十分钟到几小时。

为什么重要

对做 agent 的团队,信号很直接:在工程良好的 harness 之间换来换去,收益不如换模型;失败大头是领域知识,继续打磨 harness 的边际收益有限。对评测侧,ALE 是第一个覆盖全部 55 个 SOC/ONET 数字化行业、又全程确定性自动评分的经济型基准,GDPval 们的人工判分瓶颈被绕开。三档设计承认评测预算的现实,给不同目的留了不同入口。

也要说清楚,这是基准构建论文,贡献在任务来源和验证协议,不在算法。它能不能成为下一个 Terminal-Bench,取决于社区采用和任务池维护,这两点都还没被验证。

局限与存疑

论文自述:评测贵,只能分档并基于公开子集跑主结果;只有部分配置做了三次重复运行,方差估计不全;323 个任务还没过 QC。

读下来另有几处存疑。九成任务私有,外部无法审计任务质量和评分实现,轮换机制与跨时间可比性系于组织方单一团队。把其他 benchmark 映射到 55 域用了 LLM 辅助分类,筛 ONET 用的是 GPT-4o mini,分类误差没有全量人工校验的说明。评分边界校准是专家裁量,主结果只覆盖约 150 个公开任务,全池代表性靠附录论证。5 小时上限意味着真正的超长程工作流可能被截断,OpenClaw 的超时率已到 5.7%。

术语

原文与代码

社区讨论

相关论文

全部论文解读