ZenML 开源 Kitaru:生产 Agent 轨迹可重放换模型做反事实实验
htahir1 · reddit · 2026-08-18
ZenML 团队开源了 Apache 2.0 协议、可完全自托管的 Kitaru,解决的问题是:拿到真实生产 agent 会话后,如何在不再次调用线上工具的情况下,测试「换模型/改 prompt/改上下文/改工具策略会怎样」。
核心机制:
- 从 Langfuse、LangSmith、Braintrust、Logfire、JSONL、OpenTelemetry 导入 trace,转为可调查、可重放的 session;
- 重放时 agent 代码真实运行,但工具调用由原始录制结果应答(如原会话执行过退款,重放直接拿到录制结果,不再真退一次);
- 先原样重放建立 baseline,若无法足够接近复现原始运行,则不应信任反事实结果;之后再单变量改动重放对比。
整体工作流:生产 trace → 调查 → 分群 → 专家判断 → 评估器 → 重放 → 实验。Kitaru 可自动识别 trace 中的重复模式并提出相似会话分群,领域专家审核真实案例后用于构建和校准评估器;评估器是 repo 内的 Python 函数,随 agent 一起版本化。
作者希望社区就两个问题给出反馈:重放时如何处理工具调用、需要多高的重放保真度才敢信任「换成模型 B 会怎样」这类反事实。
所属事件:ZenML 开源 Kitaru,可将生产 Agent 轨迹重放评测(2 条相关)→
「编程与Agent」频道最新
- LlamaParse 新增修订追踪,解析红线文档更干净 — llama_index · 2026-08-18
- LangChain 直播:探讨自动化评估与环境工程 — LangChain · 2026-08-18
- Nehemiah:可移交 AI 控制的 Firecracker 微虚拟机 — Rasmic · 2026-08-18
- 构建零信任 AI Agent:Google ADK 防御提示注入实战 — rseroter · 2026-08-18
- 求本地开源网页自动化 Agent:一套 Playwright+本地 LLM 架构设想 — Weary-Release3436 · 2026-08-18
- OJO 推出设计 Agent 团队,主打 AI 时代产品品味 — kimmonismus · 2026-08-18