普林斯顿复现:HumanEval上简单重试打平复杂智能体

AI Agents That Matter

Sayash Kapoor, Benedikt Stroebl, Zachary S. Siegel, Nitya Nadgir, Arvind Narayanan

cs.LG, cs.AI

2024-07-02

普林斯顿把HumanEval上的SOTA智能体放到准确率-成本平面:升温重试达93.2%、花2.45美元,LATS准确率更低却贵五十倍。智能体评测必须控成本,否则排行榜奖励烧钱。

这篇在解决什么

智能体评测几乎只报准确率。底层模型有随机性,多采样、对着测试用例死磕,分数就能涨。AlphaCode 从接近 0% 零样本,到一千次重试超过 15%,一百万次超过 30%。SWE-Agent 把每题上限设在 4 美元。如果排行榜不看账单,最优策略就是把推理预算拉到无穷。

普林斯顿大学 Kapoor、Stroebl、Narayanan 等人没有再交一个更高分的 agent。他们指出当时评测习惯会把社区带偏:复杂架构被当成涨分原因,简单基线没人比,holdout 缺失让捷径畅通,复现脚本各自为政。

方法

他们把 HumanEval 上公开代码的三家「SOTA」放回同一套账本:LDB、LATS、Reflexion,全部依赖示例测试用例失败后再调试、搜索或「反思」。对照三条几乎不用架构的基线。Retry:温度 0 最多试五次(即便温度 0,LLM 也不完全确定)。Warming:同样重试,温度从 0 升到 0.5。Escalation:先 Llama-3 8B,失败再升 GPT-3.5、Llama-3 70B、GPT-4。每条跑五次,报 164 题的均值准确率和美元成本(2024 年 4 月价)。

第二条线改 DSPy,在 HotPotQA 上联合优化准确率和 few-shot 的 token 数。第三条用 NovelQA 说明「模型评测」和「下游采购评测」不是同一张表。第四条按意图的泛化层级,清点 17 个智能体基准该持有什么 holdout。第五条复现 WebArena 与 HumanEval 的评测脚本,列不可复现的根因。

结果

HumanEval 的帕累托图把故事说完。Warming(GPT-4)均值 93.2%(92.1–93.9),总成本 2.45 美元。Retry 92.0%、2.51 美元。零样本 GPT-4 已是 89.6%、1.93 美元。LDB(GPT-4)93.3%、6.36 美元,准确率没有统计优势,贵一倍以上。Reflexion 87.8%、3.90 美元。LATS(GPT-4)88.0%,账单 134.50 美元,比 Warming 贵五十倍以上,准确率还更低。Escalation 用 0.27 美元拿到 85.0%,比 LDB(GPT-3.5)的 0.63 美元更便宜、分数更高。论文原作者报告的 Reflexion 91% 在他们的五次复现里到不了。

HotPotQA 上,默认 DSPy 靠最多 8 条 few-shot 拉高准确率,也拉高变动成本。联合优化在 GPT-3.5 上把变动成本砍 53%,Llama-3-70B 上砍 41%,准确率持平。相对默认 DSPy,大约 1,350 次任务之后,一次性调参的固定成本就能摊平。

NovelQA 把整本小说和全部问题一次性塞进上下文,这对测长窗口模型合理,对「用户逐条提问」的产品不合理。他们估算真实顺序提问时,RAG 比长上下文便宜约 21.9 倍;基准设定里这个倍数被压成大约 2 倍,长上下文被系统性抬高。

WebArena 榜首 STeP 报 35.8%,超过原论文基线一倍。实现里有硬编码策略:Reddit 个人页直接把 URL 拼成 /user/username。网站改路径就失效。17 个基准按泛化层级,任务级 holdout 合格的 3/6,域级 1/8,跨域 0/2;7 个完全没有 holdout、也没说以后会补。HumanEval 原版 164 题里 3 题没有示例测试,各家智能体各改一版还被 PapersWithCode 揉进同一张榜。

为什么重要

2024 年这篇更像评测宪法,而不是新方法。今天看,它提前点名了后来反复出现的坑:排行榜奖励烧 token;「反思 / 调试 / 搜索」的增益可能只是多采样;模型评测的代理成本(激活参数、训练算力)会误导采购;小样本基准允许把任务写进策略。对要上线的人,正确的图是准确率对美元的帕累托前沿,并同时公布输入/输出 token,方便以后按新单价重算。对做基准的人,holdout 的粒度必须匹配你声称的泛化层级。

HumanEval 偏简单。作者自己说,System 2 技术在 SWE-bench 这类更难的编程任务上仍可能有用。这篇没有否定规划与反思,它否定的是「没控成本、没比简单重试就宣布架构胜利」。

局限与存疑

复现集中在 HumanEval 和少量 WebArena / NovelQA / HotPotQA,外推到工具密集、长时环境要小心。成本用的是 2024 年 4 月 API 价,绝对美元会过时,相对数量级(LATS 贵五十倍)更稳。Warming 能打平,部分是因为 HumanEval 自带可执行测试,真实软件工程很少有这么干净的 oracle。STeP 作者的目标是可组合的已知任务策略,和基准「真实网页智能体」的宣传不对齐,但榜上数字仍会被下游当成通用能力。人在回路几乎没测;有工作显示简单反馈能把 GPT-4 在难题上从 0% 拉到 86% 以上,缺这一维会低估可用性、高估全自动分数。

术语

原文与代码

社区讨论

相关论文

全部论文解读