Sierra τ^τ-bench 榜单:人类 82.2% 吊打最强模型 Claude Opus 5 的 23.9%
zainhas · x · 2026-09-09
Sierra 发布的新工具调用基准 τ^τ-bench(hyper-tau-bench) 排行榜揭示了 AI 在长程工具调用任务上的巨大差距:
- 人类成绩 82.2%,而最强模型 Claude Opus 5(Claude Code + max)仅 23.9%;
- 第 2、3 名为 GPT-5.6-sol(22.0%) 与 GPT-5.6-terra(18.0%),均用 Codex xhigh;
- Kimi K3 占第 4、5 名:OpenCode max 配置得 18.0%,Kimi Code max 配置 17.9%——同一个模型换 harness 相隔两天成绩有差异,引发对评测稳定性的疑问;
- Claude Sonnet 5 以 14.9% 排第 6;
- banking(银行)子基准最难,对模型和人类都是挑战;各模型在 airline/retail/telecom/banking 四个场景的分解成绩可在榜上展开查看。
基准接受社区通过 Pull Request 提交自己的 harness + builder model 配置结果。
所属事件:Sierra 发布工具调用新基准,人类远超最强模型(2 条相关)→
「模型」频道最新
- GPT-6 演示端到端 real2sim:多视角 RGB 一步建出 MuJoCo 仿真 — Scobleizer · 2026-09-09
- Anthropic 承认数学证明使用内部模型,圈内质疑其宣称 — teortaxesTex · 2026-09-09
- shuding 回应高亮基准争议:Prism.js 标注错位致结果偏差 — shuding · 2026-09-09
- Menlo 发布 4B 参数 agentic 模型 Jan-Nano,专攻深度研究任务 — GregoryDiamos · 2026-09-09
- 老用户观望:ChatGPT Astra 最低档订阅到底够不够用? — DragonsRageRS · 2026-09-09
- Anthropic 新模型首次拒向英国 AISI 开放,前 OpenAI 安全负责人称先例堪忧 — Miles_Brundage · 2026-09-09