伯克利提出 AdaMAST:用失败分类法提升 Agent 可靠性

berkeley_ai · x · 2026-08-05

伯克利 AI 研究员提出了一种名为 AdaMAST 的新方法,旨在通过让 AI 学习自身的失败模式来提升智能体的可靠性。

该方法能从原始执行轨迹中学习系统特定的失败分类法,并在后续运行中复用这些知识,以精准识别智能体在何时何地以及如何发生失败。

实验表明,将 AdaMAST 作为 Claude Code 的技能使用,能将 SWE-bench Verified Mini 的成绩从 64.0% 提升至 70.7%;在 TerminalBench 2 测试中,结合 Opus 4.6/Forgecode 框架与 Best-of-N Judge,取得了 89.9% 的高分。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →