AdaMAST:自动分类Agent失败模式,SWE-bench提升至70.7%
berkeley_ai · x · 2026-08-01
UT Austin 的研究者发布了新论文 AdaMAST(Adaptive Failure Taxonomies),提出了一种自动对 AI 智能体失败模式进行分类的方法。
- 核心机制:它能从原始执行轨迹中学习系统特定的失败分类法,并在多次运行中复用,精准定位 Agent 何时何地为何失败。
- 实测效果:作为 Claude Code 的一项技能集成后,将 SWE-bench Verified Mini 的得分从 64.0% 提升至 70.7%。
- 基准表现:在 TerminalBench 2 上,结合 Opus 4.6/Forgecode 框架与 Best-of-N 评判机制,取得了 89.9% 的高分。
所属事件:AdaMAST自动分类AI智能体失败模式(2 条相关)→
「编程与Agent」频道最新
- 实测 Xcode 27 编码智能体:搞定上架但搞不定复杂游戏逻辑 — atShruti · 2026-08-01
- JAX 引入自定义类型:实现超越张量的可微光栅化 — srush_nlp · 2026-08-01
- Hermes Desktop 推出原生插件 SDK,支持热重载与全界面定制 — NousResearch · 2026-08-01
- Hermes 桌面版发布原生看板插件及 SDK — NousResearch · 2026-08-01
- 开发者用 Gemini 搭配 Antigravity 自学硬件编程 — alexanderchen · 2026-08-01
- 需求探讨:用 LLM 开发屏幕闪烁传输的 Android 应用 — francoisfleuret · 2026-08-01