把 Agent 失败变回归测试:开发者用 Kitaru 搭建可回放评测工作流
strickvl · x · 2026-09-29
- 作者希望在 coding agent 的每次失败后让系统更难再犯,因此在 Decode 项目中集成了 ZenML 的 Kitaru。
- 核心做法:
- 每次运行都被录制为 session,可逐条检查,并将相似失败分组。
- 把这些失败 session 转化为回归测试用例。
- 当更换模型、修改 prompt、调整工具或 harness 时,可将这些历史 session 在新版本上原样回放,验证是否复现或修复。
- 这套「录制-分组-回放」流程为 agent 的持续迭代提供了一套可复用的 eval 工程方法论。
「编程与Agent」频道最新
- Every 新技能「Is This Anything」:让 AI 帮你从失败实验里挖经验 — every · 2026-09-29
- LlamaIndex 实测:文档解析如何用模型做动态路由决策 — llama_index · 2026-09-29
- Opus 5.5 联手 Runway MCP 做动态设计,附完整提示词 — notiansans · 2026-09-29
- 个人 Agent 产品 Pluto 开测:有邮箱、记忆和电脑,操作需人工审批 — Rasmic · 2026-09-29
- DeepLedger:给 QuickBooks 接上 MCP,审批即沉淀公司记忆 — Sorry-Clothes931 · 2026-09-29
- Anthropic 发布官方指南:用 Claude Code 自动构建 eval 并迭代优化 — ClaudeDevs · 2026-09-29