LLM 难以理解自身失败,新基准揭示 Agent 自我诊断短板
jiank_uiuc · x · 2026-08-15
针对 AI 递归自我改进热潮,研究者推出了 Who&When Pro,一个包含超 1.2 万个失败轨迹的大规模基准,涵盖 26 个基准测试和 15 个智能体框架。
核心发现:
- 定位尚可:当前 LLM 有时能定位失败发生的位置(Who & When)。
- 归因困难:识别底层的失败类型(Why)依然非常困难。
- 现实差距:这暴露了期望 Agent 自我诊断并从错误中学习的巨大能力缺口。
「研究」频道最新
- OpenMed:开源医疗隐私方案,数据不出内网 — aigclink · 2026-08-15
- OpenMed 开源方案解医疗数据隐私难题 — aigclink · 2026-08-15
- 论文提出离散正态分布 KL 散度的高效近似计算法 — FrnkNlsn · 2026-08-15
- RL Conference 2026 聚焦智能体与自我改进 — tw_killian · 2026-08-15
- 基于骨骼姿态估计的老年人跌倒检测系统 — rsasaki0109 · 2026-08-15
- 混合线性注意力模型计算机制新发现:全注意力层是信息处理核心 — burny_tech · 2026-08-15