ZenML 推出 Kitaru:像刷 Tinder 一样评估 agent trace
strickvl · x · 2026-09-03
ZenML 团队发布 Kitaru,一个基于回放的 agent 评测工具,直指可观测性工具的 UX 痛点:让律师、医生这类领域专家去读 JSON trace 标注问题根本不现实。
- 核心思路:把生产环境的真实 trace 导入变成可回放的 session,对出问题的 run 改动一处再重放对比,两个 run 并排即可定位原因。
- Tinder 式审阅:作者称其 trace 可视化爆火后,展示了 Kitaru 的新 UX——像刷 Tinder 一样左右滑动评估 agent trace,可用麦克风语音记录问题笔记,降低非技术人员的标注门槛。
- 工作流:一行代码包装现有 agent、导入 l trace、在编码 agent 中对话式聚类 cohort、跑实验对比新旧版本(示例中 90/90 失败降到 4/90)、盲测校验自己的标注是否可信、模型替换成本对比(成本 -61% 且质量不变)。
- 产品已在 GitHub 开源(235 star),提供 14 天免费试用。
「编程与Agent」频道最新
- Fable 5.1 发布未满 24 小时:好评如潮但额度烧得飞快 — JosephJacks_ · 2026-09-03
- 用 Azure Bicep 部署 Foundry 模型路由器 — adnan_hashmi · 2026-09-03
- Code Arena 上线 WebDev Pareto 前沿视图,按性价比排 AI 编码模型 — arena · 2026-09-03
- 30k Star 开源 reverse-skill:让 AI Agent 按规则路由 44 个逆向渗透技能 — alex_verem · 2026-09-03
- Copilot CLI 恢复会话丢失自定义 agent,MCP 服务器与工具白名单失效 — mahirhir · 2026-09-03
- Agentic DevOps 设想:AI agent 自动排查生产事故并决定下一步动作 — Pavan_Belagatti · 2026-09-03