Sierra 开源 hyper-τ-bench:评测模型能否亲手造出 Agent
karthik_r_n · x · 2026-09-10
Sierra 发布并开源了 hyper-τ-bench(论文版名为 τ^τ-bench),这是一个长程 Agent 评测,衡量模型能否亲自构建出可靠的 Agent,而不仅仅是充当 Agent。
- 任务设定:一个开发者 Agent 被放进沙盒工作区,拿到一家模拟企业的经营记录,并可随时与模拟客户沟通;它需要从分散在手册、支持记录、表格和一线员工经验中的线索里恢复需求规格、设计架构、把业务动作封装成工具,最终交付一个可用的客服 Agent。
- 对抗性细节:客户 REST API 可能存在隐蔽缺陷,开发者 Agent 需自行判断 bug 出在规格还是代码;交付的 Agent 须从固定模型菜单中选型并遵守每对话成本预算。
- 评分方式:交付后用开发者从未见过的、完全可验证的 τ-bench 风格测试,在模拟生产流量上评分。
背景:τ-bench 是 Sierra 2024 年推出的客服 Agent 可靠性评测,如今已成行业基础题;新基准回应的问题是「谁来造 Agent」——答案越来越多是模型本身。
「编程与Agent」频道最新
- 让 agent 写代码操作浏览器,LangChain 称比固定工具集更有效 — LangChain · 2026-09-10
- Tortie 成新宠:极简 agent IDE 独家短语级 red-green diff — JnBrymn · 2026-09-10
- Replit 推出 Free Mode:20 美元订阅可自动调度模型,成本最多省 30 倍 — PrajwalTomar_ · 2026-09-10
- 手把手教程:用 Google Cloud Run 沙箱安全运行不可信代码 — rseroter · 2026-09-10
- 两段提示词复刻参考视频,astra 生成 React 组件惊到网友 — john_lam · 2026-09-10
- 独立开发者优化游戏落地页:资源后台预载让启动快得多 — _jshmllr · 2026-09-10