AI分析师Agent失败分析:57%因锚定错误假设,Gemini与Grok差异显著

ArtificialAnlys · x · 2026-08-12

Artificial Analysis 对 10 款领先模型在 AA-AnalystAgent 基准上的 1,567 次失败尝试进行分类,识别出 7 种失败模式。最普遍的是早期错误假设锚定,占失败案例的 57%。模型在早期锁定某个来源或解释后,会在整个轨迹中坚持该假设。

模型间差异显著:Gemini 3.1 Pro Preview 轻信来源但执行困难,其建模、缩放和聚合错误率(51%)及跳过验证率(39%)高于中位数;而 Grok 4.5 (high) 则相反,理解领域语言但用自己的假设替代文档内容。

可靠性比原始能力更能区分领先者:GPT-5.5 (xhigh) 的 pass@1 最高(66%),Gemini 3.1 Pro Preview 和 Claude Opus 5 (max) 紧随其后(64%),但 Opus 5 在 pass^5 上领先,因为它能重复正确的工作流程。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →