ZenML 开源 Kitaru:把生产 agent 轨迹变成可重放的持续评测循环

strickvl · x · 2026-08-18

ZenML 团队发布 Kitaru 框架的重大更新,定位是「基于重放的 AI agent 评测」。

核心思路:生产环境里积累的数千条 agent traces 往往闲置无用。Kitaru 可以从 Langfuse、Braintrust 或任意 OTel 来源导入轨迹,分析哪些运行成功/失败,把重复出现的失败聚成 cohort,并围绕它们构建评测器。随后可以拿同一批真实生产案例,换模型、换 prompt、换上下文或换 agent 配置后重放对比,回答「如果改了这里会怎样」。

产品页面展示了典型流程:用 KitaruAgent 包装现有 agent、导入轨迹、在编码 agent 里让它阅读 20 条轨迹总结 cohort、跑对比实验(示例中 90/90 失败降到 4/90 失败),同一实验还可挂在每次 commit 上防止回归。项目开源且免费使用。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →