AgentDebugX 变成了 LLM 智能体的开源闭环调试器
UIUC-CS · hf · 2026-07-22
- AgentDebugX 是一个开源的 LLM agent 调试工具,把排障做成 Detect / Attribute / Recover / Rerun 的闭环。
- 核心模块 DeepDebug 会通过多轮诊断来找根因,方法包括全局轨迹理解、结构引导式排查和交叉质询。
- 在 Who and When 基准上,它在 qwen3.5-9b 上做到 28.8% 的精确 agent-and-step attribution,高于最强单轮基线的 21.7%。
- 在 GAIA 上,它一次 rerun 修复了 73 个失败任务中的 13 个,而若干解耦式自纠错基线只有 4–6 个,整体准确率从 55.8% 提升到 63.6%。
- 项目还提供 Python 库、CLI、Web 控制台和可安装的 agentic skill,并支持一个可选的 Error Hub,用于共享脱敏后的失败-诊断-修复包,充当调试记忆。
「编程与Agent」频道最新
- OpenFPM 的 CUDA 风格内核已可在 Apple GPU 上通过 Metal 运行 — Scobleizer · 2026-07-22
- Sol Pro 在语音工作流后生成了 44 文件交接包 — RileyRalmuto · 2026-07-22
- AI Dev Tools Zoomcamp 首场讲规范、上下文、循环和图工程 — Al_Grigor · 2026-07-22
- 论文提出四个条件,定义语言模型何时算代码代理 — alex_verem · 2026-07-22
- Obsidian 官方 5 个 skill 让 Claude 会写原生笔记格式 — FinanceYF5 · 2026-07-22
- MCP 让 Claude 直接读写 Obsidian 笔记无需复制粘贴 — FinanceYF5 · 2026-07-22