Argo-Bench:235 表企业级仓库考数据 agent,最强模型仅 34.8% 任务达标
textql · hf · 2026-10-02
TextQL 发布 Argo-Bench,一个超越 text-to-SQL 的企业级数据 agent 评测框架,共 210 个数据科学与分析任务。
- 设计:基于公开数据、行业文献与监管文件,模拟一个纽约外卖平台(2024 年 8100 万订单),导出为 235 张表、75 亿行的 ERP 数据仓库(仿 Oracle E-Business Suite)。仿真器的真值状态对 agent 隐藏,任务需先在仓库中导航重建事实再行动。
- 超 text-to-SQL:agent 需执行动作(封禁欺诈账号、分配骑手激励预算、补发工资等),评分器依据动作在仿真器中的后果打分;每个任务附可执行参考解,证明仅靠仓库可解。
- 结果:14 个前沿与开源模型中,最强者仅在 34.8% 任务上拿到 95 分以上,平均 59.5 分,说明企业规模数据工作流仍远未解决。
「编程与Agent」频道最新
- 幂等性与去重有什么区别?一张图讲清分布式系统常见混淆点 — _jaydeepkarale · 2026-10-02
- 开源 CodexBar 上架菜单栏:22k 星,一屏看尽各家 AI 额度 — lxfater · 2026-10-02
- Aiden Bai 预告年初以来推进的 UI 可验证性研究接近突破 — aidenybai · 2026-10-02
- ChatGPT Codex 应用新增全屏标签页,小屏开发浏览器游戏更顺手 — Dimillian · 2026-10-02
- 前 Ramp/Shopify 工程师推 Simulithic:AI 验证每个 PR 在真实环境的表现 — KlausCodes · 2026-10-02
- 让三个 GPT 模型玩《晨风》:GPT-6 Luna 找商店迷路 10 小时 — Lamppost100 · 2026-10-02