LLM智能体失效分类综述

dair_ai · x · 2026-07-08

牛津大学的一篇综述整理了 27 篇关于 LLM agent 的 benchmark、taxonomy 和审计论文,覆盖 19 个基准,尝试建立一个跨评测的统一失败分类框架。

文章总结出 6 类常见失效:工具调用与参数错误、规划与约束满足失败、长上下文累积导致的长程退化等,指出很多 agent 在不同评测里会反复出现相似问题。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →