ZenML 开源 Kitaru:生产 Agent 轨迹可重放换模型做反事实实验

htahir1 · reddit · 2026-08-18

ZenML 团队开源了 Apache 2.0 协议、可完全自托管的 Kitaru,解决的问题是:拿到真实生产 agent 会话后,如何在不再次调用线上工具的情况下,测试「换模型/改 prompt/改上下文/改工具策略会怎样」。

核心机制:

整体工作流:生产 trace → 调查 → 分群 → 专家判断 → 评估器 → 重放 → 实验。Kitaru 可自动识别 trace 中的重复模式并提出相似会话分群,领域专家审核真实案例后用于构建和校准评估器;评估器是 repo 内的 Python 函数,随 agent 一起版本化。

作者希望社区就两个问题给出反馈:重放时如何处理工具调用、需要多高的重放保真度才敢信任「换成模型 B 会怎样」这类反事实。

所属事件:ZenML 开源 Kitaru,可将生产 Agent 轨迹重放评测(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →