Kitaru 工作坊演示完整 Agent 评估流程:从真实轨迹到改进验证
strickvl · x · 2026-08-27
Kitaru 团队举办线上工作坊「Debug, Replay, Improve」,用一个客服机器人演示完整的 agent 评估闭环:
- 导入并探索真实 agent 运行轨迹(trace)
- 找出值得改进的具体行为
- 把发现转化为一个 evaluator
- 更新 agent 后重放相同测试用例
- 对比实验结果,验证改动是否真的有效
约 67 人报名参加,无需 Kitaru 使用经验,面向社区中正在构建 agent 的开发者。
「编程与Agent」频道最新
- Warmwind 演示无需 API,AI 模拟点击操作屏幕 — Med1_Ai · 2026-08-27
- 开发者用 Claude 构建公路旅行模拟器,实时动画路线 — vinishkapoor · 2026-08-27
- H3 Max 实测:30 秒出 15 秒 768p 视频,成当前最快 — techhalla · 2026-08-27
- 实测用 Grok 加 Magnific MCP 解析视频 Agent — techhalla · 2026-08-27
- 独家用 Claude 写 90+ 文件 Godot 游戏,自测测出渲染 Bug — allpotatoes247 · 2026-08-27
- ChatGPT 桌面端无法识别声明式 WebMCP 工具 — philnash · 2026-08-27