Sierra Launches τ^τ-bench, Humans Far Outpace Top AI Models
Sierra released τ^τ-bench, a new benchmark for multi-turn tool calling, where humans scored 82.2% versus Claude Opus 5's 23.9%. Kimi K3's inconsistent scores two days apart also sparked skepticism.
2026-09-09 ~ 2026-09-09 · 2 related posts