LLM 难以理解自身失败,新基准揭示 Agent 自我诊断短板

jiank_uiuc · x · 2026-08-15

针对 AI 递归自我改进热潮,研究者推出了 Who&When Pro,一个包含超 1.2 万个失败轨迹的大规模基准,涵盖 26 个基准测试和 15 个智能体框架。

核心发现:

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →