"Terminal-Bench is cooked": coders mock another saturated AI coding benchmark

rickasaurus · x · 2026-10-08

@rickasaurus declares Terminal-Bench "cooked"—saturated by frontier models—adding a self-aware jab that "clearly these are meaningless benchmarks." The thread captures the recurring debate over coding benchmarks losing discriminative power as models race past them.

Related event: Benchmarks Deemed 'Cooked' as AI Models Rapidly Top Leaderboards(2 posts)→

Original post →

More from Models

Models channel →