Sierra 发布工具调用新基准,人类远超最强模型

Sierra 发布新工具调用基准 τ^τ-bench(hyper-tau-bench),评测模型在多轮真实业务场景中调用工具的能力。榜单显示人类成绩达 82.2%,远超最强模型 Claude Opus 5 的 23.9%,暴露出 AI 在长程工具调用任务上的巨大差距。此外,Kimi K3 相隔两天成绩出现差异,也引发社区对榜单结果的质疑。

2026-09-09 ~ 2026-09-09 · 2 条相关