Agent 失败两次就补回归测试:开发者总结编码智能体调试工作流
strickvl · x · 2026-10-08
开发者 Paul Iusztin 分享他在从零构建编码 agent Decode 时遵循的原则:agent 失败一次怪模型,失败两次就该补回归测试。
他的完整调试流程:
- 记录 agent 运行为会话,失败不可避免,关键是失败后怎么做
- 将相似失败聚簇分组,按「频率 × 严重度」排优先级
- 追溯会话定位每个重要失败的根因
- 为每类失败写一个 evaluator,只回答一个问题:这个失败是否再次发生
- 修改 prompt/工具/模型/技能/harness 后,重放同一会话验证修复效果
他使用 ZenML 的 Kitaru 工具:可复用已录制的工具输出,相同工具调用直接复用、变化的调用从头执行,从而在改动后重放同一失败场景验证是否修复——避免手动重建导致失败的确切上下文。
「编程与Agent」频道最新
- GraphRAG 增量更新漏洞:删除的文档仍留在索引中可被检索 — JeremyCMorgan · 2026-10-08
- 论文:Vibe Coding 正在杀死开源,被推荐组件 Star 反跌 — soumitrashukla9 · 2026-10-08
- Every 发布 Compound Engineering 权威指南:让代码库越写越容易 — every · 2026-10-08
- Claude Haiku 5.5 发布:与 GPT-6 Luna 同价,但暗藏 token 膨胀 — Simon Willison · 2026-10-08
- 实测 Haiku 5.5 替代 Opus 跑浏览器测试:漏一项但性价比突出 — kevinkern · 2026-10-08
- Agent 测试游戏时在会议中自动启动,音乐响了 15 秒 — Aizkmusic · 2026-10-08