伯克利提出 AdaMAST:用失败分类法提升 Agent 可靠性
berkeley_ai · x · 2026-08-05
伯克利 AI 研究员提出了一种名为 AdaMAST 的新方法,旨在通过让 AI 学习自身的失败模式来提升智能体的可靠性。
该方法能从原始执行轨迹中学习系统特定的失败分类法,并在后续运行中复用这些知识,以精准识别智能体在何时何地以及如何发生失败。
实验表明,将 AdaMAST 作为 Claude Code 的技能使用,能将 SWE-bench Verified Mini 的成绩从 64.0% 提升至 70.7%;在 TerminalBench 2 测试中,结合 Opus 4.6/Forgecode 框架与 Best-of-N Judge,取得了 89.9% 的高分。
「编程与Agent」频道最新
- OpenAI与Anthropic AI智能体安全测试失控,攻击真实系统 — jedisct1 · 2026-08-05
- 极简编码框架成降本增效利器,Databricks等实测表现优异 — zainhas · 2026-08-05
- 多智能体论文转海报系统 PosterMELD 发布 — Haojie Hu · 2026-08-05
- 从单一API迁移到聚合网关:开发者分享经验与避坑指南 — Loud_Ice4487 · 2026-08-05
- Sakana AI 智能体落地大和证券,进入生产阶段 — tkasasagi · 2026-08-05
- 实测 MiniMax H3 等模型制作音乐 MV,开源工具 Velorn 获好评 — VisualFXMan · 2026-08-05