新基准 ττ-bench 曝光:最强编码 Agent 仅过 23.9%

arXiv 新论文提出端到端基准 ττ-bench,将 Agent 开发当作真实客户项目考核:模型拿到零散的公司资料、一位客户、一个 API、现有代码和预算,需要为未见过的客户需求交付可用的 Agent。结果显示,最强的编码 Agent 在客服智能体搭建考核中也仅通过 23.9%,凸显当前 Agent 在真实工程场景中的能力短板。

2026-09-21 ~ 2026-09-21 · 2 条相关