Berkeley 新数据智能体基准:顶级模型仅通过约三分之一任务

CShorten30 · x · 2026-09-14

UC Berkeley 的 Shreya Shankar 等人盘点了 25+ 个数据智能体基准,发现没有一个测试跨多数据库查询——而企业数据恰恰分散在数十套系统中。她们据此构建了 Data Agent Benchmark:54 个查询,覆盖 12 个数据集和 4 种数据库系统。

结果最好的前沿智能体也只能通过刚过三分之一的任务。失败模式揭示了 LLM 查询数据库的内在偏差:比如遇到不熟悉的 SQL 方言时,智能体会把表导出成平面文件,改用 Pandas 完成一切。

完整讨论见 Weaviate Podcast #135。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →