Sierra 发布工具调用新基准,人类远超最强模型
Sierra 发布新工具调用基准 τ^τ-bench(hyper-tau-bench),评测模型在多轮真实业务场景中调用工具的能力。榜单显示人类成绩达 82.2%,远超最强模型 Claude Opus 5 的 23.9%,暴露出 AI 在长程工具调用任务上的巨大差距。此外,Kimi K3 相隔两天成绩出现差异,也引发社区对榜单结果的质疑。
2026-09-09 ~ 2026-09-09 · 2 条相关
- Sierra 推出工具调用新基准 τ^τ-bench,Kimi K3 相隔两天成绩差异引质疑 — zainhas · 2026-09-09
- Sierra τ^τ-bench 榜单:人类 82.2% 吊打最强模型 Claude Opus 5 的 23.9% — zainhas · 2026-09-09