AdaMAST:用失败分类法提升AI代理表现
abeirami · x · 2026-07-31
开发者 @mertcemri 介绍了 AdaMAST,这是一种能从原始运行轨迹中学习系统特定“失败分类法”的方法,并能在多次运行中复用这些经验,从而精准识别 AI 代理在何时何地以及如何发生失败。
实测表明,将其作为 Claude Code 的技能使用时,能将 SWE-bench Verified Mini 的通过率从 64.0% 提升至 70.7%。在 TerminalBench 2 测试中,结合 Opus 4.6/Forgecode 框架与 Best-of-N 评判机制,使用 AdaMAST 生成的分类法取得了 89.9% 的高分。
「编程与Agent」频道最新
- Marble 获 YC 支持:用计算机视觉盘点库存,AI 自动排班订货 — ycombinator · 2026-07-31
- 单次提示连跑24小时,开发者用 Claude 打造开源 3D 小镇 — Dr_Singularity · 2026-07-31
- MCP可靠性增强实测:200次运行有害事件锐减 — FewScarcity6957 · 2026-07-31
- 一人开发者用 Grok 全程 vibe-code 3D 游戏 — Daniel_Farinax · 2026-07-31
- CodeGraph 1.0 修复符号链接越权漏洞,避免向 Agent 泄露配置密钥 — JeremyCMorgan · 2026-07-31
- Gradio 预告将支持长任务断线恢复 — Gradio · 2026-07-31