ZenML 开源 Kitaru:把生产 agent 轨迹变成可重放的持续评测循环
strickvl · x · 2026-08-18
ZenML 团队发布 Kitaru 框架的重大更新,定位是「基于重放的 AI agent 评测」。
核心思路:生产环境里积累的数千条 agent traces 往往闲置无用。Kitaru 可以从 Langfuse、Braintrust 或任意 OTel 来源导入轨迹,分析哪些运行成功/失败,把重复出现的失败聚成 cohort,并围绕它们构建评测器。随后可以拿同一批真实生产案例,换模型、换 prompt、换上下文或换 agent 配置后重放对比,回答「如果改了这里会怎样」。
产品页面展示了典型流程:用 KitaruAgent 包装现有 agent、导入轨迹、在编码 agent 里让它阅读 20 条轨迹总结 cohort、跑对比实验(示例中 90/90 失败降到 4/90 失败),同一实验还可挂在每次 commit 上防止回归。项目开源且免费使用。
「编程与Agent」频道最新
- Sentence Transformers v6.0 发布:正式引入 ColBERT 晚期交互模型 — tomaarsen · 2026-08-18
- sentence-transformers 6.0 发布:原生支持 ColBERT 式多向量晚交互检索 — tomaarsen · 2026-08-18
- Sentence Transformers v6.0 提速:fp16+FlashAttention 比 fp32 快 3.87 倍 — tomaarsen · 2026-08-18
- Sentence Transformers v6.0 落地晚期交互,史上最大版本更新 — tomaarsen · 2026-08-18
- 升级注意:Sentence Transformers v6.0 破坏性变更清单 — tomaarsen · 2026-08-18
- bfloat16 sigmoid 打乱候选排序,修复后 nDCG 从 0.18 升至 0.68 — tomaarsen · 2026-08-18