Sierra 开源 hyper-τ-bench:评测模型能否亲手造出 Agent

karthik_r_n · x · 2026-09-10

Sierra 发布并开源了 hyper-τ-bench(论文版名为 τ^τ-bench),这是一个长程 Agent 评测,衡量模型能否亲自构建出可靠的 Agent,而不仅仅是充当 Agent。

背景:τ-bench 是 Sierra 2024 年推出的客服 Agent 可靠性评测,如今已成行业基础题;新基准回应的问题是「谁来造 Agent」——答案越来越多是模型本身。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →