新基准 ττ-bench 曝光:最强编码 Agent 仅过 23.9%
arXiv 新论文提出端到端基准 ττ-bench,将 Agent 开发当作真实客户项目考核:模型拿到零散的公司资料、一位客户、一个 API、现有代码和预算,需要为未见过的客户需求交付可用的 Agent。结果显示,最强的编码 Agent 在客服智能体搭建考核中也仅通过 23.9%,凸显当前 Agent 在真实工程场景中的能力短板。
2026-09-21 ~ 2026-09-21 · 2 条相关
- ττ-Bench:最强编码 Agent 搭建客服智能体仅通过 23.9% 考核 — rohanpaul_ai · 2026-09-21
- ττ-bench:最强 coding agent 仅过 23.9% 客户模拟 — rohanpaul_ai · 2026-09-21