LLM智能体失效分类综述
dair_ai · x · 2026-07-08
牛津大学的一篇综述整理了 27 篇关于 LLM agent 的 benchmark、taxonomy 和审计论文,覆盖 19 个基准,尝试建立一个跨评测的统一失败分类框架。
文章总结出 6 类常见失效:工具调用与参数错误、规划与约束满足失败、长上下文累积导致的长程退化等,指出很多 agent 在不同评测里会反复出现相似问题。
「编程与Agent」频道最新
- 有人想给软件工程任务建「形态分类」数据库,好按任务选模型 — StewartalsopIII · 2026-09-11
- 用 prompt 造硬件:一次对话让智能体组装定制设备寄到家 — paraschopra · 2026-09-11
- 模型之外才是关键:一文拆解 RAG 到多智能体的六大 AI 架构 — goyalshaliniuk · 2026-09-11
- 零基础开发者自建分层记忆架构,仅 20k token 记住一年对话 — matteoianni · 2026-09-11
- Warp 六个非工程团队全用 Linear 和 Claude Code 工程化运作 — mon__lim · 2026-09-11
- 九年后端老兵:AI 代码不比人写的差,变糟的只是速率 — Sweaty-Landscape-561 · 2026-09-11