Terminal-Bench 3.0 发布:顶级模型分暴跌,Agent 只会修补症状

ajratner · x · 2026-08-25

Snorkel AI 团队发布 Terminal-Bench 3.0 深度分析。新基准增加了难度,导致顶级模型得分从 2.1 版的 84% 骤降至 3.0 版的 43.5%。文章通过两个实战任务揭示了当前 AI Agent 的核心失败模式:

这些案例表明,尽管 Agent 在单步执行上表现尚可,但在涉及复杂系统推理和多组件交互的真实工程任务中仍存在巨大鸿沟。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →