ττ-bench:最强 coding agent 仅过 23.9% 客户模拟
rohanpaul_ai · x · 2026-09-21
新基准 ττ-bench 把 agent 开发当成真实的客户项目来考:模型拿到零散的公司资料、一位客户、一个 API、现有代码和预算,要为未见过的客户需求交付一个可用的 agent。
核心发现:
- 最强组合 Claude Opus 5 + Claude Code 在 53 个任务的保留客户模拟中仅通过 23.9%,而专家手写的参考实现通过率高达 82.2%。
- 失败大多出在纯写代码之外:agent 倾向于「检索」资料而非「理解」资料,几乎不向客户提问确认需求,习惯复用熟悉的设计方案,写的测试也常常发现不了自身的错误。
- 需求沟通直接决定成败:在允许向客户提问的任务上,0 次提问的构建平均得分仅 0.16,提问 4 次以上的平均 0.50。
结论:单纯提升代码生成能力不够,未来的 coding agent 还需要学会收集需求、对比设计方案、合理使用预算,并部署前用测试暴露自身盲区。
所属事件:新基准 ττ-bench 曝光:最强编码 Agent 仅过 23.9%(2 条相关)→
「编程与Agent」频道最新
- MiniMax H3 成功跑在 4060 Ti 16GB 上,作者分享完整工作流设置 — GranDaddyP · 2026-09-21
- Google 开源 ARTEMIS:AI 智能体可像人一样操控真实手机 — dr_cintas · 2026-09-21
- Agent 业务该不该追新框架?创业者纠结自研 harness 换代成本 — niketrodriguez · 2026-09-21
- x402 探索者发问:真的有 agent 在自主赚钱花钱吗? — thranduilsson · 2026-09-21
- 清华 DiffuTester 用扩散 LLM 生成单测,速度提升 2-3 倍 — jiqizhixin · 2026-09-21
- 把整台电脑变成 Agent 工作台:玩家在 Omarchy 上聚合 Claude 与 Codex — Teknium · 2026-09-21