ττ-Bench:最强编码 Agent 搭建客服智能体仅通过 23.9% 考核
rohanpaul_ai · x · 2026-09-21
arXiv 论文《$τ^τ$-Bench: An Environment for End-To-End, Realistic Agent Construction》(Quan Shi、Keshav Dhandhania、Karthik Narasimhan、Victor Barres)提出把「搭建 Agent」本身作为基准任务的测试环境。
- 任务设置:开发 Agent 拿到真实企业会保存的记录、持有需求的客户、运营必须走的生产 API、一份待继承的代码库,以及服务成本与可用模型限制——还原真实客户交付场景。
- 评测方式:产出的客服 Agent 被部署到留出的模拟用户上进行打分,共 53 个任务、覆盖四个领域。
- 结果:最强组合 Claude Opus 5 + Claude Code 仅通过 23.9% 的评测模拟,而专家手写的参照上限为 82.2%。
- 失败模式:模型对记录只做浅层查询而非深入理解需求、几乎不与客户沟通、对 Agent 架构和服务成本实验不足,直接上线第一个能跑的设计。
结论:当前编码 Agent 在真实 Agent 交付上失败的主因是对需求理解不够深,仅改进代码生成无法解决问题。
所属事件:新基准 ττ-bench 曝光:最强编码 Agent 仅过 23.9%(2 条相关)→
「编程与Agent」频道最新
- MiniMax H3 成功跑在 4060 Ti 16GB 上,作者分享完整工作流设置 — GranDaddyP · 2026-09-21
- Google 开源 ARTEMIS:AI 智能体可像人一样操控真实手机 — dr_cintas · 2026-09-21
- Agent 业务该不该追新框架?创业者纠结自研 harness 换代成本 — niketrodriguez · 2026-09-21
- x402 探索者发问:真的有 agent 在自主赚钱花钱吗? — thranduilsson · 2026-09-21
- 清华 DiffuTester 用扩散 LLM 生成单测,速度提升 2-3 倍 — jiqizhixin · 2026-09-21
- 把整台电脑变成 Agent 工作台:玩家在 Omarchy 上聚合 Claude 与 Codex — Teknium · 2026-09-21