DSAgentBench: Can Agents Automate End-to-End Data-Science Workflows in Real Computer Environments?
Mizanur Rahman, Mohammed Saidul Islam, Ridwan Mahbub, Md Tahmid Rahman Laskar, Shafiq Joty, Enamul Hoque Prince
cs.AI, cs.CL
2026-08-11
DSAgentBench 用 275 个覆盖数据科学全流程的真电脑任务评测 Agent,确定性评估器校验数值、图表与模型效果;最强 Claude-4.6-Sonnet 只过 56.70%,开源模型全部低于 1%。
数据科学的真实工作不止写一段代码,还要在一台真电脑里来回切工具:从数据库或网页把数据弄进来,做探索性分析、特征工程、建模,最后画图、写报告。整个过程要在 VS Code、Jupyter、终端、浏览器之间反复跳,前一步的输出决定后一步怎么做。
现有的 Agent 基准都对不上这个画面。HumanEval、DS-1000、MLAgentBench、DSBench 这类只考代码生成或孤立的推理,Agent 根本不碰操作系统;OSWorld、WebArena 这类考的是「能不能操作电脑」,不是「能不能当数据科学家」。两者之间一直缺一块:Agent 能不能在一台真电脑里把一条端到端的数据科学流程走完。DSAgentBench 就是要填这块。
基准包含 275 个任务,覆盖数据科学全生命周期的六个阶段:数据获取(23)、探索性分析(119,占 43.3%)、特征工程(37)、建模(41)、评估与部署(12)、可视化与报告(33)。难度上硬任务占 47.6%、中等 46.9%、简单只有 5.5%,56.7% 的任务要多轮迭代。数据以表格为主(95.3%),少量图像和文本;工具上 Python 占 100%、VS Code 81.1%、Jupyter 18.9%、Chrome 10.2%。
任务构造很扎实:数据来自 Kaggle、OpenML、SQLite、GitHub 和网页 API;四位 5 年以上经验的数据科学家花了约 400 小时设计任务,LLM 只用来润色措辞,不负责设计任务逻辑;每个任务由第二位标注者独立跑一遍验证,初始一致率 86%,修订后全部达成共识。
评估器是确定性的 Python 程序,不看代码、看产出:数值结果要在 ε=0.01 容差内;可视化要核对坐标轴、标题、图例和数据映射是否正确(用 GPT-4o 当视觉裁判,再用 Gemini-2.5-Pro 裁判 GPT-4o 的输出以避免循环);模型指标要达到阈值(如准确率或 F1 ≥ 0.7)。每个任务给一个 [0,1] 的连续分,达到 0.95 算成功。Agent 有两种观察方式:纯截图,或截图加无障碍树(A11y,经 AT-SPI 提取,给 Agent 额外的结构化 UI 元素信息)。
测了 15 个模型。在「截图加无障碍树」设置下:
| 模型 | 成功率 |
| 人类基线 | 85.09% |
| Claude-4.6-Sonnet | 56.70% |
| GPT-5 | 29.81% |
| GPT-4o | 24.54% |
| Gemini-2.5-Pro | 20.81% |
| 开源模型(UI-TARS、GUI-OWL、OpenCUA 等) | 全部低于 1% |
最强模型 Claude-4.6-Sonnet 也只到 56.70%,离人类的 85.09% 还差近 30 个点。加上无障碍树普遍有帮助:纯截图时 Claude-4.6-Sonnet 是 50.55%、GPT-4o 是 19.34%,加了 A11y 各自升到 56.70% 和 24.54%。开源模型基本全废,失败里 97-98% 是 grounding 错误,也就是连「点对按钮」都做不到。
失败原因各不相同:GPT-4o 八成(80.00%)死在 grounding;Claude-4.6-Sonnet 的代码错误反而最多(43.70%),grounding 占 32.77%;Gemini-2.5-Pro 在终端环境上栽得最狠(36.15%)。两个诊断结论很关键:单阶段任务明显好过多阶段;把步数预算从 15 提到 50,收益微乎其微(GPT-4o 从 19.34% 只到 20.73%),说明卡点不在时间长短,在中间步骤的推理和工具协调本身。Jupyter 比 VS Code 表现好,因为终端和环境故障更少。
这个基准给「电脑操作型数据科学 Agent」立了一根可信的尺子:确定性评估器校验的是分析正确性、图表质量和模型效果,不是代码能不能跑。从业者可以直接拿它衡量自家的 computer-use Agent。
几个结论也值得记住:开源模型在这个任务上还谈不上可用(全部低于 1%),瓶颈是 grounding 而非推理;闭源前沿模型集体远低于人类,说明端到端多工具协调仍是硬骨头;多给步数没用,意味着进步要靠单步质量,不是靠堆预算。
开源模型不能使用无障碍树,只在纯截图设置下评测,所以「全部低于 1%」部分是设置限制,不完全是能力天花板。错误分析基于 604 条闭源和 150 条开源轨迹的子集,可能漏掉稀有失败模式。可视化评估只看最终产物的质量,可能忽略图表清晰度等更细的方面。另外人类基线是 85.09% 而非 100%,说明有些任务对人也不轻松;0.95 的成功阈值配 ε=0.01 的数值容差在数值题上偏宽松,真正的差距其实在 grounding 和多步推理上。整个基准在真实电脑环境里跑,跑全套(15 个模型乘 275 个任务)成本和时间都不低。