Survey on LLM Agent Failure Taxonomies

dair_ai · x · 2026-07-08

A review from the University of Oxford analyzes 27 papers on LLM agent benchmarks, taxonomies, and audits across 19 benchmarks, aiming to establish a unified cross-evaluation failure taxonomy.

The paper identifies 6 common failure categories: tool calling and parameter errors, planning and constraint satisfaction failures, and long-range degradation caused by accumulated long contexts. It notes that many agents repeatedly exhibit similar issues across different evaluations.

Original post →

More from coding & agent

coding & agent channel →