Berkeley 新数据智能体基准:顶级模型仅通过约三分之一任务
CShorten30 · x · 2026-09-14
UC Berkeley 的 Shreya Shankar 等人盘点了 25+ 个数据智能体基准,发现没有一个测试跨多数据库查询——而企业数据恰恰分散在数十套系统中。她们据此构建了 Data Agent Benchmark:54 个查询,覆盖 12 个数据集和 4 种数据库系统。
结果最好的前沿智能体也只能通过刚过三分之一的任务。失败模式揭示了 LLM 查询数据库的内在偏差:比如遇到不熟悉的 SQL 方言时,智能体会把表导出成平面文件,改用 Pandas 完成一切。
完整讨论见 Weaviate Podcast #135。
「编程与Agent」频道最新
- 开发者想让 AI 机器人自创游戏:Freebots 拟接入 GDL 框架 — Daniel_Farinax · 2026-09-14
- Weaviate 论文揭示:LLM 给数据库下命令常误用 LIKE 代替搜索 — CShorten30 · 2026-09-14
- Obsidian 电子书阅读器所用 foliate-js 开源地址公布 — vista8 · 2026-09-14
- 把 Obsidian 改造成电子书阅读器:foliate-js 技术复盘 — vista8 · 2026-09-14
- Matt Pocock:所有公司都在急招 AI 编码人才,机会在你自己 — mattpocockuk · 2026-09-14
- 红队测试公开 Agent 的速赢清单:找到边界何处失守 — njyx · 2026-09-14